**WASTE** 是一个极简的、基于 C 语言的推理引擎,旨在让消费级硬件也能运行前沿规模的模型(例如拥有 2.78 万亿参数的 **Kimi K3**)。 WASTE 并没有将整个模型加载到内存中,而是利用混合专家(MoE)架构,将模型的一个小型“主干”常驻内存,每生成一个 token 时,仅从磁盘流式传输活跃的 4% 模型权重。它没有任何第三方依赖,并绕过内核页面缓存,实现从 NVMe 到内存的直接数据吞吐。 **核心技术亮点:** * **性能:** 在 64GB MacBook Pro 上,运行 K3 模型时可达到约每秒 0.5 个 token。对于较小的模型(如 48B 参数),速度可达每秒约 10 个 token。 * **效率:** 它将内存管理置于计算之上;通过精细平衡专家缓存以匹配机器的物理内存,防止因操作系统页面调度导致的性能瓶颈。 * **设计:** 它完全可嵌入,运行时无需 Python、CUDA 或 BLAS。它采用基于磁盘的量化格式,将磁盘读取视为推理循环的核心组成部分。 WASTE 证明了万亿参数规模的模型无需数据中心级硬件也能在本地运行,为云端 API 提供了一种私密且经济高效的替代方案。
作者将 20 世纪 90 年代美国对密码技术的出口管制,与当前政府限制尖端人工智能模型访问权限的举措进行了对比。二十五年前,OpenBSD 项目通过去中心化的国际网络在全球范围内分发加密代码,公然反抗美国将加密技术定义为“武器”的法规。这种草根层面的抵制成功证明了此类管制只会阻碍守法公民,却无法阻止意志坚定的行动者。 如今,美国正将类似的限制逻辑应用于人工智能领域,要求外国公民在访问强大模型时需获得许可。然而,作者认为这些安全措施往往会适得其反,导致防御者在面对那些利用海外开源权重模型绕过使用政策的攻击者时,处于更加不利的地位。正如密码技术最终因开源社区的坚持而变得普及,作者相信人工智能终将走向同样的开放分发状态。历史的教训是,自由与安全并非通过政府监管实现,而是源于那些跨国界构建并共享技术的人们的坚定努力。为了保持人工智能领域的开放,作者认为当下需要类似的抗争与去中心化协作。
在一场简短的视频通话中,管理层告知团队公司将裁减 7% 的员工,其中包括通话中的所有人员,并宣布终止他们的项目。尽管团队成员对他们卓有成效的工作被突然叫停表示震惊和沮丧,但管理层将此决定归咎于充满挑战的宏观经济前景以及“精简规模”的需要。 公司提供的遣散方案包括相当于两周工资的代币,以及获取悲伤辅导提示的权限。此次会议引发了强烈的抵触情绪,参会者多次中途退出,凸显了团队对于裁员方式过于仓促以及所提供的支持极其匮乏的愤怒。
尽管JPEG标准已有30多年的历史,但得益于其高效的“有损”压缩,它依然是数字图像领域的主流格式。这种方法通过策略性地丢弃人眼感知较弱的信息(特别是色彩和高频视觉细节)来减小文件体积。
编码过程包含以下几个关键步骤:
1. **色彩分离**:将图像从RGB转换为YCbCr格式,将亮度(Y)与色彩(Cb/Cr)分离开来,因为人眼对亮度更为敏感。
2. **数据缩减**:对次要的色彩信息进行下采样。
3. **频率变换**:将图像划分为8x8像素的块,并通过离散余弦变换(DCT)转换为频率数据。
4. **量化**:根据用户选择的质量设置,对次要的高频数据进行除法和取整处理,从而产生重复的模式。
5. **最终压缩**:使用标准的无损技术对处理后的数据进行压缩。
解码过程则是上述步骤的逆向操作,利用插值法重建缺失的色彩数据。虽然这一过程会导致少量的原始信息损失,但它有效地平衡了文件大小与视觉质量,使JPEG得以保持其在网页和摄影领域的主导地位。
在最近一次“宽带早餐”(Broadband Breakfast)专题讨论会上,行业专家探讨了打击网络钓鱼、骚扰电话和垃圾信息这一持久挑战。与会专家强调,虽然 STIR/SHAKEN 身份验证等工具很有用,但它们并非“灵丹妙药”。从传统有线网络向互联网语音通话的转变使通信更加普及,这让犯罪分子能够以低廉的成本轻松利用系统,他们往往利用人工智能,甚至通过获取合法电话号码来绕过安全防线。 由于电信运营商无法获知通话内容,且行业生态系统高度碎片化,专家们认为没有任何单一技术能解决这一问题。相反,他们主张采取多层次的防御措施:对企业进行更严格的“了解你的客户”(KYC)审查、加强跨行业协作,并提高消费者的警惕性。尽管针对有组织犯罪的执法工作已取得进展,但专家们告诫不应让电信运营商对诈骗损失承担法律责任,并警告称此类措施可能引发有害的过度屏蔽。归根结底,专家强调消费者仍是最后一道防线;他们呼吁公众举报可疑活动,并在有疑问时,在回复前先暂停并核实来电者的身份。
在试验了他们的“Manifest”大语言模型(LLM)路由后,Manifest 团队得出结论:模型路由通常不值得其所带来的权衡代价。尽管业界大肆炒作路由在成本优化方面的作用,但 Manifest 决定弃用自家的路由功能,并提出了几个关键问题:
* **误导性的复杂性:** 提示词的复杂程度通常取决于路由器无法识别的外部上下文(如文件大小或工具需求),这使得准确路由几乎成为不可能。
* **更优的替代方案:** 缓存是一种更可靠、更有效的降本方法,这往往使路由所需的“粘性”变得多余。
* **一致性与控制力:** 动态切换模型会降低输出的一致性。工程师应将大语言模型视为专用工具;为特定任务选择合适的模型,能确保更高的质量并更好地掌控工作流。
* **增加的复杂性:** 路由的不可预测性引入了维护、可观测性和调试方面的隐性成本,这些成本往往超过了推理费用上节省的那点小钱。
最终,Manifest 认为,对于大多数专业用例而言,坚持使用单一且经过实战检验的模型,比依赖复杂的自动化路由层更高效、更可预测且更易于维护。