元脉高性能AI网络 激发算力潜能(元脉是什么意思)

元脉高性能AI网络 激发算力潜能(元脉是什么意思)

8月9日,以“智联万物 网聚未来”为主题的2025 AI网络技术应用创新大会在京召开。浪潮信息旗下元脉网络应邀参会,元脉网络副总经理陈翔发表主题为“元脉高性能AI网络,助力算力潜能释放”的演讲,详细介绍了元脉网络在AI网络上的创新与实践。

元脉网络副总经理 陈翔

AI业务规模化发展 三大挑战亟待解决

随着人工智能技术的迅猛发展,智算中心的集群规模持续扩大,AI 网络建设亟需攻克在“部署效率、系统稳定性、资源负载”三方面的挑战。

● 部署缓慢,影响业务上线效率 当前 AI 应用正呈现与业务深度渗透融合的态势,“如何提高部署效率、实现业务快速上线”已成为 AI 网络建设面临的首要问题。然而,集群规模的急速扩张,大幅提升了网络部署与调优的难度。以传统 RoCE 技术为例,其拥塞控制主要采用DCQCN技术,而该技术的参数需进行针对性调优,这直接导致拥塞控制部署流程复杂,进而影响业务上线效率。

● 通信时长、系统故障,制约算力释放 集群建设涉及 GPU、网络、光模块等大量组件及复杂协议栈,当前训练流量以大象流为主,这类流量具有同步突发特性,易因通信等待造成大量算力损耗;与此同时,卡间通信还陷入“训练规模越大,平均无故障时间越高”的悖论。据业界公开数据显示,在 AI 系统故障中,网络因素占比超 10%,已成为制约 AI 技术发展的重要瓶颈。

● 大模型训推混跑,网络资源负载不均衡 随着大模型框架的陆续开源,在业内激发出新一轮部署热潮。但大模型的快速部署,也让模型内部出现“训练+推理”混跑的连锁反应,在这样多任务混跑条件下部署的网络,会出现性能下降、流量相互干扰、及网络资源负载不均衡等问题。

元脉网络打造高性能、高可靠AI Fabric方案

为解决上述问题,元脉网络凭借前瞻性的技术洞察和创新能力,推出高性能、高可靠的AI Fabric方案。该方案由元脉RoCE技术、AI Fabric交换机、及智能运管平台三大核心组件构成,可以实现AI网络的端网一键部署、流量精准可视、故障智能预测,为大模型训推提供坚实的网络基础,保障模型训推的高效、稳定和可靠运行。

在部署效率和稳定性上,元脉网络智能运管平台ICE支持端网一键部署,可以统一纳管交换机、网卡、光模块、GPU、服务器等设备,实现拓扑配置一键校验、全网自动上线。同时,支持训前一键NCCL压力测试,将部署时间从数周缩短到数天,极大简化用户的运维部署成本。

此外,元脉网络AI Fabric方案搭建了更先进的高精度遥测核心技术,可实现AI流量的精准可视。并具备灵活可编程特性,不仅支持数据的自定义监测与网络性能的AI调优,还能有效提升算力资源利用率,确保业务流量零干扰运行。

三级“可靠”加固 AI网络“安全感”拉满

为提高智算中心集群网络的可靠性,元脉网络从“设备-链路-系统”三个维度进行可靠性加固,降低智算中心建设过程中的单点故障率,提升系统无故障训练时间,激发算力潜能。

● 设备级可靠:元脉网络AI Fabric方案内置独创的 IGE 智能防护引擎,硬件层面采用RAS可靠性架构设计,对所有关键部件实施冗余备份,真正实现“单一设备失效,整个系统无感运行”;软件层面采用模块化架构,将业务模块进行容器化隔离部署,确保各模块独立运行、互不干扰,同时为关键模块配备热重启与热升级功能,充分满足AI网络环境的高稳定性要求;此外,通过独立的管理监控平台OpenBMC,提供更高级别的安全防护与可靠性保障,全方位适配AI时代数据中心的管理需求。

● 链路级可靠:由于集群规模庞大,光模块数量众多,一旦光模块发生故障,将极大影响大模型的训练进程。对此,元脉网络AI Fabric方案可实现对光模块各项指标的精准监控,能够实时掌握其健康状态并提前预警,达到故障“主动预警、提前干预”的目的,有效减少训练中断的情况,降低故障带来的影响。

● 系统级可靠:在系统级可靠性设计方面,元脉网络AI Fabric方案具备多重技术优势。一是采用智能负载均衡技术,当链路发生故障时,智能负载均衡可依据全局链路状态,重新均衡AI流量,性能较传统RoCE领先2.3 倍;针对单平面架构易出现单点故障的风险,方案采用多平面架构技术,为算力持续可用提供坚实保障,不仅可以实现 AI 通信零中断,更使有效训练时长占比高达 99%。

AI赋能未来 互联构筑基石

元脉® 浪潮信息旗下网络业务品牌,作为AI时代网络创新引领者,可以为用户提供面向AI时代的智算中心、数据中心、边缘网络等全栈网络方案。并坚持智能、开放、可靠的发展理念,不断深化自身在技术创新、场景创新、合作创新方面的能力,为AI时代算力、数据价值的释放,打造坚实互联基石。

特别声明:[元脉高性能AI网络 激发算力潜能(元脉是什么意思)] 该文观点仅代表作者本人,今日霍州系信息发布平台,霍州网仅提供信息存储空间服务。

猜你喜欢

59岁巩俐罕见现身,和76岁法国老公悠闲度假,堪称最幸福谋女郎(巩俐30年前旧照)

对于巩俐提出的婚姻要求,张艺谋的回应,充满了对婚姻的轻蔑——在他看来,那不过是一张纸,毫无意义。或许很多人会怀疑,巩俐是否会因此感到一丝不甘,是否会对张艺谋身边的陈婷心生羡慕,但若她曾经历过那样的隐忍,早已深…

59岁巩俐罕见现身,和76岁法国老公悠闲度假,堪称最幸福谋女郎(巩俐30年前旧照)

早秋职场穿搭,严谨与随性间平衡,尽显清新雅致高级魅力(秋季职场穿搭女)

告别盛夏的热烈,也尚未步入深秋的厚重,早秋的职场穿搭恰好处于一种美妙的平衡点:它既需要保持职场的严谨与专业,又不失对个人风格的表达,融入一份恰到好处的随性与舒适。 白色西装与裤子的套装,清爽有夏日感,适合初秋…

早秋职场穿搭,严谨与随性间平衡,尽显清新雅致高级魅力(秋季职场穿搭女)

2025-2031年中国MP3播放器市场全景调查与行业发展趋势报告(2020 mp3)

2024年开始,国产品牌的MP3播放器也进入市场当中,以纽曼、蓝魔、魅族等企业为代表的MP3播放器企业占据了国内MP3播放器市场主要份额。5.2.3 MP3播放器与CD播放器的区别 5.3.3 MP3播放器…

2025-2031年中国MP3播放器市场全景调查与行业发展趋势报告(2020 mp3)

CSI-F969 多功能低温测定仪(倾点、凝点、冷滤点)GBT 3535 型号齐全-东莞程斯

精确温控:通过制冷(压缩机制冷半导体制冷)与加热系统,控制冷却速率(如倾点测定时,初始阶段3℃h,接近预期温度时1℃h),确保结果准确性。 多功能低温测定仪通过精确温控与自动检测,高效、准确地测定油品…

CSI-F969 多功能低温测定仪(倾点、凝点、冷滤点)GBT 3535 型号齐全-东莞程斯

建筑废料再利用自动分拣机报价-四川成都建筑废料再利用自动分拣机报价(建筑废料再利用论文数据不多怎么写)

建筑废料再利用自动分拣机针对混凝土块、砖石、钢筋、木材等混杂建筑废料,通过 “智能识别 + 准确分选” 的集成设计,构建了高能回收体系,在建筑废料资源化再利用中展现显著优势。某建筑废料处理站数据显示,引入该自…

建筑废料再利用自动分拣机报价-四川成都建筑废料再利用自动分拣机报价(建筑废料再利用论文数据不多怎么写)