发布时间:2023-06-28
点击次数: aigc的爆发除了带来算力上的挑战,对网络的要求也达到了前所未有的高度。
6月26日,腾讯云首次对外完整披露自研星脉高性能计算网络:星脉网络具备业界最高的3.2T通信带宽,能提升40%的GPU利用率,节省30%~60%的模型训练成本,为AI大模型带来10倍通信性能提升。腾讯云的新一代算力集群HCC可以支持超过10万卡的巨大计算规模。
腾讯云副总裁王亚晨表示:“星脉网络是为大模型而生。它所提供的大带宽、高利用率以及零丢包的高性能网络服务,将助力算力瓶颈的突破,进一步释放AI潜能,全面提升企业大模型的训练效率,在云上加速大模型技术的迭代升级和落地应用。”
构建大模型专属高性能网络,提升40%GPU利用率
AIGC的火爆带来AI大模型参数量从亿级到万亿级的飙升。为支撑海量数据的大规模训练,大量服务器通过高速网络组成算力集群,互联互通,共同完成训练任务。
相反,GPU集群越大,额外通信损耗越多,大集群并不意味着大算力。AI大模型时代给网络带来了重大的挑战,包括高带宽要求、高利用率和信息无损。
传统低速网络带宽无法满足千亿、万亿参数规模的大模型,在训练过程中,通信占比可高达50%。同时,传统网络协议容易导致网络拥塞、高延时和丢包,而仅0.1%的网络丢包就可能导致50%的算力损失,最终造成算力资源的严重浪费。
基于全面自研能力,腾讯云在交换机、通信协议、通信库以及运营系统等方面,进行了软硬一体的升级和创新,率先推出业界领先的大模型专属高性能网络——星脉网络。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
在硬件方面,星脉网络基于腾讯的网络研发平台,采用全自研设备构建互联底座,实现自动化部署和配置。
在软件方面,腾讯云自研的TiTa网络协议,采用先进的拥塞控制和管理技术,能够实时监测并调整网络拥塞,满足大量服务器节点之间的通信需求,确保数据交换流畅、延时低,实现高负载下的零丢包,使集群通信效率
达90%以上。
此外,腾讯云还为星脉网络设计了高性能集合通信库TCCL,融入定制化解决方案,使系统实现了微秒级感知网络质量。通过使用动态调度机制来合理分配通信通道,可以有效避免由于网络问题导致的训练中断等情况,并将通信时延降低40%。
ChatGPT Writer
免费 Chrome 扩展程序,使用 ChatGPT AI 生成电子邮件和消息。
106
查看详情
网络的可用性,也决定了整个集群的计算稳定性。为确保星脉网络的高可用,腾讯云自研了端到端的全栈网络运营系统,通过端网立体化监控与智能定位系统,将端网问题自动定界分析,让整体故障的排查时间由天级降低至分钟级。经过改进,大型模型训练系统的整体部署时间已缩短为4.5天,保证了基础配置的100%准确性。
历经三代技术演进,软硬一体深耕自研
星脉网络全方位的升级背后,是腾讯数据中心网络历经三代技术演进的成果。

在腾讯发展初期,数据中心网络流量主要由用户访问数据中心服务器的南北向流量构成,网络架构以接入、汇聚、出口为主。这一阶段主要使用了商用网络设备,搭建标准化数据中心网络,支撑QQ在线人数增长超过1亿,服务器规模增长超10万。
随着大数据和云计算的兴起,服务器之间的东西向流量逐渐增多,云租户对网络产生了虚拟化和隔离的要求。数据中心网络架构逐渐演变为同时承载南北向和东西向流量的云网络架构,腾讯云构建了全自研网络设备与管理系统,打造超大规模数据中心网络,服务器规模近200万台。
腾讯云在国内先行推出了高性能计算网络,以满足AI大模型的需求,并采用了东西向和南北向流量的分离架构。构建了独立的超大带宽、符合AI训练流量特征的网络架构,并配合自研软硬件设施,实现整套系统的自主可控,满足超强算力对网络性能的新需求。
日前,腾讯云发布的新一代HCC高性能计算集群,正是基于星脉高性能网络打造,可以实现3.2T超高互联带宽,算力性能较前代提升3倍,为AI大模型训练构筑可靠的高性能网络底座。
未来,腾讯云还将持续投入基础技术的研发,为各行各业的数智化转型提供有力的技术支撑。
以上就是面向AI大模型,腾讯云首次完整披露自研星脉高性能计算网络的详细内容,更多请关注其它相关文章!
# AI大模型
# 前代
# 清远短视频关键词排名
# 非遗推广营销策略分析
# 徐州网站建设服务电话
# 用于推广的网站吗
# 网站推广需要ip
# 装饰画海报模板网站推广
# 威海抖音seo系统
# 宁河区怎样网络营销推广
# 提高贴吧关键词排名
# 桓台县seo网站推广
# 上海
# 丰田
# 中国科学院
# 互联
# 开源
# 东西向
# 首次
# 高性能
# 腾讯
# 自研网络
# 高性能计算
相关栏目:
【
行业新闻62819 】
【
科技资讯67470 】
相关推荐:
类GPT模型训练提速26.5%,清华朱军等人用INT4算法加速神经网络训练
AI大模型时代,数据存储新基座助推教科研数智化跃迁
如何提高集群协作效率?中外团队合作研发基于均值偏移的机器人队形控制策略
一文看懂基础模型的定义和工作原理
网易易盾 AI Lab 论文入选 ICASSP 2025!黑科技让语音识别越“听”越准
出门问问亮相2025世界人工智能大会,展示AI CoPilot解决方案
美图公司影像节或发布AI设计新品
一家 380 亿美元的数据巨头,要掀起企业「AI 化」革命
调查显示:实际上没有那么多人在用 ChatGPT
陈根:ChatGPT和人类合作开发机器人
扎克·施奈德新片《月球叛军》曝剧照 机器人首度现身
马斯克:将来机器人比人类多!特斯拉机器人亮相人工智能大会
Transformer六周年:当年连NeurIPS Oral都没拿到,8位作者已创办数家AI独角兽
微软向美国政府提供GPT大模型,如何保证安全性?
对Hugging Face开源模型精准投毒!LLM切脑后变身PoisonGPT,用虚假事实洗脑60亿人
世界水下机器人大赛:9国青年携手逐梦深蓝
零AI含量!纯随机数学无限生成逼真3D世界火了,普林斯顿华人一作
解决导航“最后50米”难题 高德地图升级AR步行导航找终点功能
常见的五个人工智能误解
人工智能:解决劳动力短缺的关键策略
央视报道!星纪魅族集团车载人机交互技术成世界移动通信大会焦点
周星驰支持的人工智能与 Web3 初创公司 Moonbox 完成 100 万美元融资
Moka发布AI原生HR SaaS产品“Moka Eva”,布局AGI时代
Gartner发布中国企业人工智能趋势浪潮3.0
美图公司吴欣鸿:AI技术重构影像产业
九号公司主导制定短途交通和送物机器人领域首个国际标准,标志着零的突破发布
推动综合能源服务高质量发展
七大主流AI企业包括OpenAI、谷歌等联合承诺:引入水印技术,并允许第三方审核AI内容
谷歌推出RT-2视觉语言动作模型,使机器人能够掌握垃圾丢弃技能
国家发改委组织工业机器人产业高质量发展现场会
元宇宙迈入2.0时代,它和生成式人工智能有何关联吗?
字节团队提出猞猁Lynx模型:多模态LLMs理解认知生成类榜单SoTA
能源电力数字化转型恰逢其时
鸿蒙生态带来了哪些新的流量可能性,包括AI、服务分发和原生智能等方面?
中国AI公有云市场2025年逆势蓬勃增长,增速高达80.6%
微软为 AI 初学者推出免费网课:为期 12 周,共 24 节课
70年前他本想逃避考试,却影响了整个互联网
【原创】奥比中光:与英伟达合作开发的3D开发套件正式发布 连接英伟达AI应用生态
“直击”AI新世界,智能机器人再次“火出圈”了
最大助力35公斤 外骨骼机器人或在养老、医疗领域“大展身手”
生成式人工智能进入产业应用!但再“聪明”仍是工具,最终目的是服务于人
AI连线 | 专访风平智能CEO林洪祥:让AI数字人拥有漂亮的外表和有趣的灵魂,安全问题是重要考量
GPT-4使用混合大模型?研究证明MoE+指令调优确实让大模型性能超群
航拍无人机怎么选?大疆无人机盘点推荐
加速电网转型升级推进新型电力系统建设
英国前首相:AI可能被用来制造“生物恐怖武器”
改变城市交通:智慧城市中的智能交通
“世界上最像人的机器人”接入 Stable Diffusion ,现场完成作画
微软Xbox称VR和AR还需要时间 先玩大的
国宝级文物“铜兽驮跪坐人顶尊铜像”完成模拟拼接,腾讯AI立功