
9 月 7 日,KubeCon CloudNativeCon OpenInfra Summit PyTorch Conference China 2026 同期活动 「Hardware-Aware AI: Building PyTorch Workloads Across Accelerators」 在上海国际会议中心举行。
本场活动由华为主办,汇聚 PyTorch Foundation、昇腾以及多个开源项目的技术专家与开发者,围绕PyTorch框架优化、大模型训练与推理、AI 编译器等关键技术展开分享与交流。随着大模型持续演进,AI计算对底层基础设施的性能与易用性提出了更高要求。如何充分释放硬件能力,同时保持开发者熟悉、高效的PyTorch开发体验,正在成为AI基础设施演进的重要方向。
围绕这一命题,昇腾持续从框架适配、编译优化等关键环节完善PyTorch开发栈,通过软硬件协同,将底层算力能力进一步转化为开发者可用、易用的计算效率。

开放协作,共建 PyTorch AI 开源生态
活动开场,PyTorch Foundation Executive Director Mark Collier 致辞,对现场开发者及社区伙伴的参与表示欢迎。
作为全球广泛应用的AI开源框架,PyTorch的持续演进离不开开发者、硬件厂商以及上下游开源项目的共同参与。随着模型规模和计算复杂度不断提升,如何通过开放协作持续拓展PyTorch的能力边界、降低开发者使用不同计算资源的门槛,也成为社区持续关注的重要方向。

TorchNPU:让PyTorch更好地运行在昇腾上
Ascend for PyTorch TC Member李晶在框架与硬件适配层围绕《TorchNPU:昇腾上的PyTorch框架优化设计与实践》展开分享。TorchNPU持续深化PyTorch与昇腾 NPU的软硬件协同,在保持PyTorch原生开发体验的基础上,通过运行时、通信和编译等关键环节的优化,进一步提升执行效率与资源利用效率。
TorchNPU的核心价值,在于以软件层承接硬件差异,让开发者保持一致的PyTorch 使用体验,同时通过底层优化持续释放昇腾NPU性能。让上层保持一致、易用的PyTorch开发体验,让底层充分释放昇腾NPU的硬件能力,是TorchNPU持续演进的重要方向,也是昇腾将算力能力转化为开发者生产力的重要一环。

Triton-Ascend:让编译器更“懂”昇腾NPU
Triton-Ascend社区Maintainer杨开昕以《Triton-Ascend AI编译器的优化策略和实践》为题,展示了Triton这一算子开发范式在昇腾NPU上的落地实践。
从Layout、Autotune、流水调度到 SIMT/SIMD混合执行,其核心目标都是提升硬件利用率,让更多底层性能优化由编译器自动完成,在降低开发者优化负担的同时充分释放昇腾NPU性能。Hardware-Aware的价值并非让开发者面对更多硬件细节,而是让编译器更“懂”硬件,以更高层的软件抽象承接底层复杂性,让硬件性能更自然地转化为开发者可获得的计算效率。

活动现场,来自 DeepSpeed、vLLM-Omni、FlagTree 等开源项目的技术专家,也分别从大模型分布式训练、全模态推理及 AI 编译等方向分享最新实践,进一步拓展了围绕 AI 基础设施演进的技术交流。
共话“好用”的AI基础设施
随着硬件选择越来越丰富,开发者需要面对的不只是“性能是否足够”,还有更加现实的问题:不同硬件之间如何降低迁移和适配成本?性能优化与一致的开发体验如何兼顾?开源社区又应该在其中发挥怎样的作用?
活动现场围绕 “开源社区如何定义‘好用’的AI基础设施”,来自不同技术领域的嘉宾展开圆桌对话。

对于开发者而言,“好用”的AI基础设施不仅意味着更高的性能,也意味着更低的开发门槛、更成熟的软件工具链,以及更加顺畅的开发体验。
通过持续完善框架、编译器等软件能力,让底层硬件性能更充分地转化为开发者可以直接使用的生产力,也是昇腾持续投入PyTorch生态的重要方向。
免责声明:本文为转载,非本网原创内容,不代表本网观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
如有疑问请发送邮件至:bangqikeconnect@gmail.com