9月11日至13日,以"共织算力网 智启新未来"为主题的2026中国算力大会在河北廊坊举行。作为国内算力领域规格最高的国家级产业盛会,大会汇聚了全产业链数百家企业与上万名专业观众,全力助推我国算力产业高质量、集约化、普惠化发展。
翼华科技芯片架构师邹玥在本届算力大会上发表了题为《AI算力网络的端网协同,重构Token成本曲线》的主题演讲,分享了以端网协同技术提升GPU利用率、降低Token成本的路径与实践。

大模型应用加速落地,"算力贵"已成为产业发展关键瓶颈。邹玥指出,行业评价AI网络往往先看端口速率和带宽,但算力中心真正的核心指标是"每百万Token成本"——即总投入除以真正能交付的有效Token数量。网络同时影响这两头,而最大的降本杠杆,来自减少GPU等待。
这一问题在AI场景中尤为突出:训练中GPU同步协作,一张卡慢了全队都得等;推理中"短期记忆"传输慢或波动大,运营方只能多备GPU。传统以太网的局部拥塞、业务感知不足等短板,在AI工作负载下被进一步放大。"投入同样数量的GPU,能不能稳定输出更多满足业务要求的Token?这才是算力中心真正需要回答的问题。"邹玥说。
面对这一痛点,翼华科技提出了"端网协同"技术架构,核心思路是让应用端、网卡和网络设备不再各干各的,而是实时通讯、互相配合。端侧软件了解业务优先级,知道哪些数据更紧急;智能网卡让数据不经过CPU可直接在GPU、内存和网络之间走"快车道";交换网络掌握全局路况,把拥塞、故障信息实时反馈给端侧。三者形成闭环,网络从被动"管道"变为动态"智能调度系统"。
翼华科技将这套架构命名为ELink,由端侧运行层(ERT)、网卡执行层(ERNIC)与网络协同层(ERSW)三大组件构成,重点解决单集群大规模扩展和跨数据中心协同两大场景,在机间和跨域层面提升传输效率,撬动GPU利用率。"端口速率决定物理上限,端网协同决定这些带宽有多少能够稳定转化为有效吞吐。"邹玥强调,后者才是降本的关键。

翼华科技已形成覆盖智能网卡(SmartNIC)、超级网卡(SuperNIC)与面向分布式推理的AI-DPU的完整产品矩阵规划。其中,图南一代为国内首款P4可编程开源网卡,已实现大规模商用出货;图南二代面向下一代智算网络,强化了可编程能力,支持更大规模的集群扩展;AI-DPU则创新性实现KV Cache硬件卸载、跨节点共享上下文内存池、向量数据库检索全链路卸载,补齐GPU与底层存储间缺失的高速缓存层级,大幅减少模型重复计算,降低集群推理综合成本,同时兼容vLLM、SGLang等主流推理框架,存量集群可快速平滑接入。
在实际应用中,端网协同方案已在大模型训练、MoE推理、Prefill与Decode分离、多租户与跨域调度等场景中逐步展现降本价值。邹玥在演讲最后表示"让系统产出更多满足用户体验要求的Token,同时减少被等待、拥塞和故障浪费的算力。计算、网络和调度形成协同,才能持续降低每个Token的成本。"翼华科技也将继续坚持"双芯驱动、全栈服务"战略,以端网协同架构与图南系列产品助力算力中心降本,为我国智能计算基
免责声明:本文为转载,非本网原创内容,不代表本网观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
如有疑问请发送邮件至:bangqikeconnect@gmail.com