前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >腾讯云联合浪潮发布白皮书, 助力大规模数据中心高效稳定运行

腾讯云联合浪潮发布白皮书, 助力大规模数据中心高效稳定运行

作者头像
吴微不至
发布2021-09-02 15:47:14
7730
发布2021-09-02 15:47:14
举报
文章被收录于专栏:腾讯云星星海腾讯云星星海

7月27日,在第三届OCP China Day大会上,腾讯云联合浪潮发布《数据中心服务器智能故障诊断TIFDS(Tencent & Inspur Fault Diagnosis System)系统技术白皮书》,其中腾讯云与浪潮联合研发的TIFDS系统架构,为大规模数据中心提升服务器运维效率,保障数据中心稳定运行提供重要参考。

以腾讯云数百万服务器运营数据和浪潮深厚的固件研发专家经验库为基础,“TIFDS”系统可利用AI技术对海量服务器运行数据实时分析,对各类部件故障实时预警,故障诊断“火眼金睛”,故障自动明确化率提升至95%以上,远超业界平均水平。

大规模数据中心服务器猛增

人力运维接近极限

伴随着互联网企业的崛起,云计算市场已走过十多年的时间,据Gartner数据统计,2020年全球云计算市场快速增长,增速超过40%,中国云计算市场也持续两位数增长,市场增长动能逐渐从泛互联网向产业化快速渗透,增长持续加速。

云计算的快速扩张带来了数据中心服务器数量的爆发式增长,传统的服务器故障运营面临着更大的挑战和更高的成本,从最初的脚本运维、工具运维到平台运维,人力已接近极限,逐渐无法满足快速修复故障以及恢复业务运行的要求。为高效管理海量服务器,智能化的监控诊断系统已成为大规模数据中心的发展趋势。

TIFDS系统架构

故障自动明确化率可达95%以上

腾讯云与浪潮联合研发的TIFDS系统具有风险实时预警,故障精准诊断和日志定制化透明安全等特点,对提升大规模数据中心运维效率具有重要意义。

■风险实时预警: 该系统基于腾讯云现网运行的百万台服务器运维经验,结合AI智能算法,可对非宕机类故障进行实时预警,降低服务器高负荷运行下突然失效的风险。

■故障精准诊断: 通过AI的技术对于海量的运营数据进行实时的分析,从而实现了对内存、CPU和PCIe这些部件的故障的自动化诊断, 将整个故障自动明确化率提升至95%以上。

■日志定制化透明安全:创新性日志输出上报方式,使诊断过程清晰透明,并对疑难问题进行了识别并建立了线上联合诊断系统,不断提升系统运维效率。

腾讯云在全球数据中心服务器数量早已超过百万台,此次发布的TIFDS系统,不仅能大幅提升自身数据中心的服务器运维效率,为腾讯云平台的稳定运行提供坚实的技术支撑,也将为各类新兴应用在公有云平台的大规模落地提供良好的技术储备。

——腾讯云服务器运营中心副总经理

严勇

TIFDS是数据中心服务器运维技术的重要创新,是腾讯云与浪潮双方基于JDM模式,打破原有产业链上下游合作模式,进行联合研发的又一成果。此次,浪潮与腾讯云将TIFDS架构进行梳理,联合发布了业界首个数据中心故障运维白皮书,为提升数据中心运维效率和云计算稳定性具有重要的借鉴意义。

——浪潮信息研发项目管理部总经理

宋晓锋

想要了解更多星星海服务器及相关信息,欢迎扫码关注腾讯云星星海公众号!

点击查看白皮书

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2021-07-30,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 腾讯云星星海 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
相关产品与服务
项目管理
CODING 项目管理(CODING Project Management,CODING-PM)工具包含迭代管理、需求管理、任务管理、缺陷管理、文件/wiki 等功能,适用于研发团队进行项目管理或敏捷开发实践。结合敏捷研发理念,帮助您对产品进行迭代规划,让每个迭代中的需求、任务、缺陷无障碍沟通流转, 让项目开发过程风险可控,达到可持续性快速迭代。
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档