虽然大语言模型(LLM)从技术上讲是通过自回归方式输出词元(token)的“下一个词元预测器”,但这种定义是不完整的。它准确描述了其“机制”(即循环的形式),却未能涵盖模型实际在“做什么”。 在预训练阶段,模型通过模仿训练数据中已有的序列来进行学习。然而,现代的后训练技术——特别是带有可验证奖励的强化学习(RLVR)——从根本上改变了这种动态。模型不再仅仅是预测数据集中接下来会出现什么文本,而是开始探索新的序列,并强化那些能带来成功结果的序列。 作者用国际象棋做类比来阐明这一点:一个预测大师走法的系统只是“下一步棋预测器”,但一个通过评估棋局位置以最大化胜率的引擎则是一个“战略求解器”。同样地,现代大语言模型利用“下一个词元”循环作为载体,其所编码的内容远超简单的模仿;它们模拟出乐于助人的助手,并运用通过主动探索所获得的知识。归根结底,将先进的大语言模型仅仅描述为“下一个词元预测器”,是将工具的形式误认为是其功能,忽略了蕴含在过程中的推理及目标导向行为。
伟大的作品很少源于一时的顿悟,它们往往是数十年反复打磨的结晶。
计算机科学家斯蒂芬·罗伯逊(Stephen Robertson)花费了近二十年的时间来完善搜索算法。从1976年开始,他通过强调词项区分度来挑战当时主流的检索理论,并在一篇篇论文中不断迭代,最终在1994年发布了经典的BM25算法。通过整合词频和文档长度等要素,他将早期的概率基础转化为了行业标准。
同样,艺术家葛饰北斋也是在经过四十年的专注磨砺后,才创作出了他的代表作《神奈川冲浪里》。他在73岁时曾感叹,自己对自然的终身研究仍在演进,并将自己的艺术生涯视为一场通往“神圣境界”的无止境攀登。
这些例子揭示了一个共同的模式:无论是技术还是艺术,精通都是一个缓慢且积累的过程。真正的突破并非来自突如其来的灵感,而是源于一生中不断重温、精炼并深化核心理念的耐心。
在尝试训练小型、低效的大语言模型(LLM)来自动化终端任务后,作者得出结论:对于简单的工作流,机器学习往往是不必要且浪费的。这一认识促成了 **TERMy** 的诞生,这是一个基于名为 **NPC-Forge** 的新框架构建的确定性轻量级终端助手。
与笨重的自然语言理解(NLU)框架(如 Rasa)或资源密集型的大语言模型不同,NPC-Forge 使用结构化数据集格式(NDF)来定义命令、意图和变量映射,无需进行训练。通过利用多阶段的噪声过滤解析器——从精确匹配到基于 IDF 加权的莱文斯坦距离(Levenshtein distance)——TERMy 能够在包括微控制器在内的极简硬件上即时执行任务。
该项目旨在摒弃针对琐碎操作的昂贵且受企业控制的人工智能,转而推崇一种民主、透明且节能的替代方案。TERMy 和 NPC-Forge 允许用户构建并共享可在本地运行的、可预测的自定义代理。作者承认该代码尚处于早期开发阶段,并邀请社区贡献力量以完善这些确定性代理的安全性与功能,主张未来的交互界面应依赖于本地的、基于规则的系统,仅在万不得已时才调用大语言模型。