PrismML 发布了 **Ternary Bonsai 2 27B**,这是一款基于 Qwen3.8 27B 的高效多模态 AI 模型。通过采用三值化 {−1, 0, +1} 权重压缩技术,该模型的权重位宽有效降至 1.76 比特,使得模型体积仅为 5.9GB。 尽管体积小巧,该模型仍保留了全精度模型 98.2% 的综合性能。这种“近乎无损”的压缩技术显著提升了智能密度,增强了模型在推理、编程、视觉及智能体方面的能力。该模型支持 262K token 的上下文窗口,并针对 NVIDIA GPU(通过 CUDA)和 Apple Silicon(通过 MLX)的本地部署进行了优化。 除了性能出色,Ternary Bonsai 2 27B 在能效方面表现卓越:在 RTX 5090 上运行速度可达每秒 143 token,且能耗比标准 8B 模型降低了 40%。这一性能特点使其非常适合编程智能体和私有高频工作流等本地应用场景。该模型基于 Apache 2.0 许可证发布,证明了低比特架构能够有效弥合高阶智能与受限硬件环境之间的差距,有望重塑 AI 在各类设备和数据中心的部署方式。