以下是根据SEO优化原则(关键词布局自然、段落逻辑清晰、语义丰富、避免堆砌、增强可读性与专业性)人工风格重写后的中文文章。在保留全部核心技术信息与事实准确性的前提下,进行了结构重组、术语通俗化表达、长句拆分、主语明确化、价值点前置,并强化了“昇腾+DeepSeek”协同生态的行业意义,更契合百度/微信搜一搜/知乎/Bing等中文搜索引擎的语义理解偏好。
(由多段落组成):
国产AI算力迎来关键突破:DeepSeek正式开源昇腾全栈加速组件,开启芯模协同新范式
9月30日,国内领先的大模型研发团队DeepSeek宣布完成面向华为昇腾AI芯片平台的基础设施级开源——这是继其GPU生态工具链之后,首次系统性构建面向国产AI芯片的高性能软件栈。本次开源涵盖编译层、计算层与通信层三大核心模块,包括自主设计的TileLang高级编译框架、DeepGEMM/FlashMLA/TileKernel/DeepSelect等新一代昇腾原生算子库,以及支持超大规模训练的DeepEP分布式通信库。此举不仅填补了国产AI芯片在大模型底层加速工具链上的关键空白,更标志着中国AI基础软件生态正从“可用”迈向“好用、高效、易扩展”的新阶段。
为什么昇腾+DeepSeek的组合如此重要?
昇腾950芯片及其超节点架构(如SuperPoD Flex与UBL128组网方案),凭借开放的Ascend C编程接口与PTO指令集体系,为深度定制化算子开发提供了坚实底座。DeepSeek团队正是基于这一开放能力,实现了从高级语言(TileLang)到硬件指令的端到端编译优化路径。尤为值得关注的是:昇腾生态并未“一刀切”强制开发范式,而是同时支持资深工程师的手动调优与算法工程师的声明式编程,真正兼顾性能极限与开发效率——这对降低国产AI芯片使用门槛、加速产业落地具有深远意义。
实测性能亮眼:单卡推理吞吐破5100 tokens/s,通信带宽逼近硬件极限
在华为联合提供的UBL128全互联超节点上,DeepSeek-V4.1-Flash模型展现出卓越的工程化能力。实测数据显示:采用EP32部署策略,在Offline纯模型推理模式下(ContextLength=128K,Dspark投机接受率0.85),当端到端延迟(TPOT)控制在10ms时,单卡输出吞吐高达5102 tokens/秒;在5ms严苛延迟约束下仍保持2469 tokens/秒的高吞吐。更值得称道的是,DeepEP通信库在EP/CP/PP/FSDP等主流并行策略下均实现极致优化,实测Dispatch带宽达375 GB/s、Combine达347 GB/s,已无限接近昇腾硬件理论上限。
不止于训练与推理:覆盖Agentic RL、长上下文KV Cache池化、低精度量化等前沿场景
此次开源成果已全面集成至华为CANN社区,并配套发布十余项开箱即用的技术实践指南。覆盖从单卡轻量部署、单机低延时推理,到千卡级超大规模训练;从超长文本(128K)下的KV Cache动态池化优化,到面向Agent智能体的RLHF训练框架(鲲鹏CPU+昇腾950+灵衢协同);还包括AMCT低精度量化、TileLang算子Agent化开发、CANNBot-DSL融合算子编程等创新方向。所有技术文档均提供完整复现路径与性能对比数据,开发者可一键克隆、快速验证。
共建开放、高效、可持续的AI软件生态
“基承其本,算展其用”——这不仅是DeepSeek与华为昇腾的合作宣言,更是中国AI产业走向自主可控的关键路径。通过模型团队与芯片厂商的深度对齐,双方正在打通“模型设计→算子实现→编译优化→集群调度→Agent应用”的全链路闭环。未来,随着更多模型厂商接入昇腾生态,叠加CANN工具链持续迭代与开发者社区壮大,一个真正立足本土、比肩国际、服务千行百业的AI基础软件新生态,正在加速成型。
量子位【阅读原文】

