| AOT SuperKernel图执行优化 |
从 Aclgraph 的 Stream 与 Task 调度出发,介绍 AOT SuperKernel 如何融合任务并减少启动、调度等待和算子间流水开销。 |
2026.7 |
| LongCat-Flash-Lite昇腾推理优化实践 |
围绕 N-gram Embedding 与 EAGLE3 投机解码,结合 ComputeNGramIds 算子优化和 SuperKernel 提升 LongCat-Flash-Lite 推理效率。 |
2026.6 |
| 星火大模型昇腾算力集群吞吐优化实践 |
依托 CANN DSA 系列算子将长上下文 Attention 动态稀疏化,在星火大模型 128K 场景实现最高约 4.5 倍 Decode 吞吐提升。 |
2026.6 |
| TensorFlow与AutoFuse推荐模型算子融合实践 |
打通 TensorFlow 到 Ascend IR 与 AutoFuse 后端的自动融合链路,通过 Schedule、Auto Tiling 和代码生成提升推荐模型性能。 |
2026.5 |
| NPU DeepSeek-V4推理优化实践 |
针对 DeepSeek V4 的稀疏 Attention 与 mHC 结构,结合融合算子、上下文并行、量化和多流并行实现高性能 NPU 推理。 |
2026.4 |
| AutoFuse与TorchInductor的DeepSeek算子融合实践 |
扩展 TorchInductor NPU Codegen,将 Loop IR 转换为 Ascend IR 并接入 AutoFuse,为 DeepSeek 模型带来自动算子融合收益。 |
2026.4 |
| DeepSeek V4昇腾超节点支持 |
介绍昇腾 950 与 A3 超节点对 DeepSeek V4 推理和续训练的适配,包括融合 Kernel、多流并行、量化与自动融合能力。 |
2026.4 |
| xLLM大模型推理性能优化 |
结合 xLLM 的图融合、多流并行、投机推理和动态负载均衡,优化 Qwen、DeepSeek 与 ChatGLM 等模型的昇腾推理性能。 |
2026.4 |
| SALS长序列推理优化 |
从稀疏 Token 选择、SFAA 计算、离散访存、Preload 流水和 AICPU Tiling 等方面优化长序列推理。 |
2026.4 |
| HIXL快速适配NIXL昇腾后端 |
基于 NIXL 插件架构和 SouthBound API,将 HIXL 点对点通信能力映射为昇腾后端,简化上层框架接入。 |
2026.3 |
| Overlap Scheduling吞吐优化 |
通过 CPU 调度与 NPU 执行重叠隐藏下发时延,提升设备利用率,在 LongCat-Flash 场景中带来约 70% 的 TPS 提升。 |
2026.3 |
| 第三方框架集成npugraph_ex |
介绍第三方框架如何接入 npugraph_ex 的图编译与编译缓存能力,进一步降低模型推理冷启动和端到端耗时。 |
2026.2 |
| HIXL FabricMem高性能KV Cache传输 |
通过超节点 DRAM 统一编址、VMM 映射和 HCCS/SDMA 单边传输,为 Mooncake 等 KV Cache 池化系统提供高带宽 FabricMem 通道。 |
2026.2 |
| 基于Atlas 900 A3 SuperPoD推理部署Deepseek-R1性能优化实践 |
结合 Omni-Infer 与 CANN 全栈协同优化,在满足 TTFT<2s、TPOT<50ms 的前提下实现 608 QPM 高吞吐推理。 |
2025.12 |
| HIXL、Mooncake与vLLM的KV Cache池化与传输 |
通过 HIXL、Mooncake和vLLM实现KV Cache 池化和高性能 D2D/H2H 传输提升前缀缓存命中率,降低 TTFT 并减少大集群推理成本。 |
2025.12 |
| HIXL在RL推理中的长尾时延优化 |
利用 HIXL 支撑 RL 推理阶段的 PD 分离与高效数据传输,缓解长尾拖慢问题并提升千卡集群资源利用率。 |
2025.12 |
| 基于Atlas 900 A3 SuperPoD的LongCat-Flash模型推理性能优化实践 |
结合多流并发、控核与 SuperKernel 等优化手段,显著提升 LongCat-Flash 推理效率,并将 TPOT 优化到 10ms。 |
2025.12 |
| CANN npugraph_ex图模式优化 |
npugraph_ex基于 aclGraph 图捕获与重放能力降低 Host 下发开销,并提供亲和 NPU 的图优化,帮助推理框架获得更低时延。 |
2025.12 |
| 基于torch_npu的IPC特性介绍 |
IPC支持跨进程直接共享设备内存,减少显式拷贝开销,在分布式训练和强化学习场景中提升通信效率并节省显存。 |
2025.12 |
| TorchAir自定义FX Pass |
用自定义 FX Pass 将多流并行等优化从手动脚本改造成自动图变换,减少重复适配代码并提升开发效率。 |
2025.12 |
| SGLang、Mooncake与CANN HIXL的PD分离D2D部署 |
打通 SGLang、Mooncake 与 HIXL 的协同链路,加速 PD 分离 D2D 特性落地,提升 KV Cache 传输效率与部署灵活性。 |
2025.11 |
| SuperKernel技术综述 |
通过将整网重新编译为大算子减少调度与访存开销,在现有优化基础上进一步带来 10% 到 20% 的性能提升。 |
2025.11 |
| vLLM-Ascend推理优化 |
vLLM-Ascend 基于 PagedAttention 和昇腾适配优化 KV Cache 管理与推理执行,提升大模型服务吞吐量并降低内存浪费。 |
2025.11 |