本仓库提供了一套生产就绪的配置,用于在单张 **AMD MI300X GPU** 上运行 **DeepSeek-V4-Flash-0731 (304B)** 模型。
由于 vLLM 的官方方案主要针对 NVIDIA 或更新的 AMD 硬件(MI325X/MI355X),本配置解决了 MI300X (gfx942) 架构的关键兼容性问题。主要功能包括:
* **正确性补丁**:修复了 FP8 格式不匹配(FNUZ 与 OCP)、MoE 路由错误以及 CPU-KV 同步问题。
* **性能调优**:针对 gfx942 的定制 AITER GEMM 调优表、融合 SiLU 内核以及推测性解码(DSpark-7)配置。
* **资源效率**:将整个 304B 模型置于 MI300X 的 192GB HBM 中,无需权重卸载。采用混合 KV 策略,使用 20GB GPU 缓存和 96GB CPU 内存卸载。
* **生产栈**:包含镜像摘要固定的 Docker Compose 环境、Caddy HTTPS 代理及经过验证的运行时组件。
**性能亮点:**
* **预填充(Prefill)**:约 7,000 tok/s。
* **解码(Decode)**:约 168 tok/s(单流),支持扩展至 64 个并发流且不会内存溢出(OOM)。
* **可靠性**:在 256K 上下文下经过验证,支持工具调用及长上下文“大海捞针”测试。
本仓库提供了针对 vLLM 上游代码的字节级只读覆盖层和统一差异补丁,以确保完全的透明度和可复现性。