最新工程实录 · 2026.09.17 性能优化

DeepSeek V4.1 Flash 工程实践(四):长 Prefill 与最后一公里优化

DeepSeek V4.1 Flash 跑通之后,真正困难的是让 261K 乃至 1M 冷输入稳定前进,同时保持官方稀疏语义和完整输出。收官篇沿着长 prefill 的真实瓶颈,解释跨层候选筛选、无损整数索引、一次展开、动态 LDS、dense 分块、chunk 与 arena 如何共同作用,并公布最终保留的 1553.91 token/s 长输入速度、1M 完整验收和单路及八路 decode 数据。

阅读全文
ZLLM VISION

努力成为最好的推理引擎

Rust 原生以所有权和类型系统守住内存与并发安全,同时保留贴近硬件的极致性能。
统一架构以清晰的正交分解抽象 Model、Runtime、Backend、Kernel 与 Algorithm,统一 CPU、GPU、NPU 的开发与优化路径。
全场景覆盖同一套推理技术栈,从资源受限的嵌入式设备延伸到超大规模集群。