2026年7月,PyTorch官网正式上线Ascend NPU支持,华为昇腾成为中国首个被PyTorch官方硬件目录收录的NPU。两个月后的9月19日,华为全联接大会2026举办的"携手业界主流开源社区,解锁昇腾创新新动能"专题论坛,全面展示了这五年来昇腾与开源社区深度融合的成果。
从适配到成为官方硬件
自2020年昇腾与PyTorch合作起步,到如今Ascend for PyTorch社区已汇集超过一千位核心开发者,外部PR占比超过50%,成为中国发展最快的AI社区。7月Ascend NPU进入PyTorch官方支持名单,昇腾CI体系达到社区L3标准,成为全球首个达成该标准的中国硬件。
9月9日的PyTorch Conference China 2026峰会上,超节点Live Demo完成了基金会首秀,这标志着昇腾不再只是通过兼容层接入,而是与PyTorch从适配对接迈向生态共建。
CI/CD体系达到L3标准
L3标准要求昇腾CI结果对上游PR可见,这意味着每一次PyTorch代码变更,开发者都能立即看到在昇腾NPU上的编译与测试反馈。这一体系重构了海量测试用例,接入了官方CI/CD流水线,不仅提升了质量,更标志着昇腾已经深度嵌入PyTorch的开发运维流程。相比多家国内AI芯片仅提供配套驱动,L3级别要求的是与上游开发同步进行的完整CI。
vLLM Ascend:优化长序列KV Cache存储
vllm-ascend Maintainer在论坛中分享了KVPool与DSA KV Offload技术的进展。面对混合注意力、混合架构带来的缓存语义异构和前缀缓存规则不统一等挑战,团队实现了Multi KV Group支持,存储上支持SSD卸载,传输上支持超平面内存语义。
更值得关注的是DSA KV Offload方案。针对长序列下片上内存容量不足的问题,该方案使用冷KV卸载至CPU DRAM、异步加载、叠加两层Overlap等技术,在GLM-5.2 TP16上使TTFT降低21%-30%,吞吐达DCP方案的2.8至3.8倍。
ACAGEMMs:算子自动生成系统的探索
郑州先进实验室在论坛上展示了ACAGEMMs算子自动生成系统。该系统以涵盖语义、输入域、边界条件、验收标准和运行环境的任务契约贯穿生成、验证、测量与交付全过程。
ACAGEMMs借助候选树、证据链、经验树三大机制管理搜索、验证与经验复用,并设置编译、正确性、性能三层Gate对候选做静态预检与归因筛选,失败证据反向约束下一轮搜索。在昇腾A2上的测试表明,该系统能有效筛选高质量候选,加速比达1.42,Token消耗降低55%。
值得注意的是,团队本身就是FlagGEMS等开源项目的核心贡献者,致力于通过开源分享降低算子开发门槛。这与此前文章探讨的TritonNext 2026共同指向同一个趋势:AI算子正在走向通用的跨硬件编程抽象。
开放系统加速AI演进
Linux基金会和PyTorch基金会的代表在演讲中强调,国内AI硬件百花齐放,但若软件栈各自为战将导致严重碎片化。PyTorch基金采用从Ecosystem到Hosted的两级孵化体系,现已托管vLLM、DeepSeek、Ray等项目。由昇腾团队主导的Accelerator Integration Working Group,正在推动"PyTorch跑在任何云、任何加速器上"的战略。
PyTorch 2.14的发布、昇腾CI达到L3水平等,均是开放协作的成果。
从"支持"到"共建"
Ascend for PyTorch社区开发者王贝琦在论坛中分享了自己的开源参与经历。她将"从支持到共建"总结为四步:代码跑通、在NPU上正确运行、API测试与文档生态完全对齐、将通用能力回馈上游。
她强调,共建NPU生态并非为NPU添加特殊分支,而是帮助上游实现特性设备无关。开发者可以从小处着手,一个API、一条测试、一个Issue或PR,都能成为开源协作的起点,从代码使用者变为上游贡献者。
结语
从PyTorch官方支持到CI体系L3标准,从vLLM推理优化到ACAGEMMs算子自动生成,昇腾的进展折射出中国AI硬件生态正在发生的质变——从追赶CUDA的功能兼容,转向参与国际开源社区的基础设施建设。随着更多加速器厂商加入PyTorch官方生态,AI硬件有望迎来开放协作的"通用语"时代。

发表评论 取消回复