DeepSeek V4.1 Flash 工程实践(四):长 Prefill 与最后一公里优化
从官方跨层候选筛选、无损索引展开和动态 LDS,到 dense 分块、chunk 与 arena:DeepSeek V4.1 Flash 在八卡 ROCm 上的最终优化路径与性能数据
从官方跨层候选筛选、无损索引展开和动态 LDS,到 dense 分块、chunk 与 arena:DeepSeek V4.1 Flash 在八卡 ROCm 上的最终优化路径与性能数据
从 image_url 到视觉塔、aligner 与双偏置 MoE 路由:用逐段张量对拍修正 DeepSeek V4.1 Flash 的图文链路
ROCm 接入实录:读对 FP8 权重,让共享 KV、稀疏选择与 mHC 状态跨过 GPU 边界
ROCm 工程实践:从记忆检索到 AVX-512、NUMA 与 CPU/GPU 协同
我们把 MiniCPM5-2B 塞进 zllm-app,在高通 NPU 上完全离线运行。带着一台手机穿越古代,种粮、制肥、酿酒、翻译、练兵、办工坊,现代文明从此随身携带。
让每台 1T 主机内存承接长历史,把同时解码的上下文容量推向 15+ 倍;50K 单路实测近乎无损。完整记录每次决策、失败与转向。
双路 Intel Xeon E5-2696 v4 + NVIDIA GeForce RTX 3060 12 GiB,运行 Qwen3.8-Flash-Next(UD-Q4_K_XL)
我们把来自阿布扎比的 K2-Horizon MoVA 接入 zLLM,在 Apple M5 24 GiB 上跑通 IQ3_XS、Q8 KV 与 Metal replay,再实测它做题和写中文究竟怎么样。
这可能是真正可用 GLM5.3 最低成本的方案
从 token、向量与矩阵乘法讲清 Transformer 的一次完整推理,并逐一对应 zLLM 的 CPU oracle、注意力、KV Cache、FFN/MoE 与 prefill/decode 模块。
量化为什么既能让大模型装得下,也可能跑得更快;为什么 4-bit 常是甜点位;以及分层、校准、质量评估、生成围栏与思考链失真的工程边界。
结合 zLLM 的 ROCm 实现,解释 DeviceBuffer、RocmTensor、RocmWeight、Arc、Mutex、view owner 与 HIP event 如何组成一套覆盖 CPU 内存、显存和异步执行的生命周期机制。
zLLM 如何把模型规格、完整模型运行时、领域语义、后端能力与设备实现分开,让平台 backend 和参数化 kernel 作为并列轨道独立演进。
用户只输入一句话,Agent 却可能先向模型注入数十 K 甚至更多上下文。本文从 Claude、Codex 的真实请求链路出发,讲清三种 HTTP 接口、cache hit、显存/SSD 两级前缀缓存和工具调用围栏。
zLLM 为什么选择以 Rust 为主体,从模型执行、资源生命周期和硬件能力出发,重新设计一个原生推理引擎。
一个 8 MB 级原生可执行文件,加上一份 Gemma 4 E4B 模型,就能在 Mac 上对话、理解图片,也能作为 Rust 库直接嵌入现有程序。