使用“规划”阶段来优化 AI 编程任务(即由高端模型编写计划,再由低成本模型执行)往往效率低下且适得其反。由于智能体的成本主要随读取的标记(上下文)数量而增加,“规划”方法会迫使两个模型阅读相同的文档,从而造成成本的重复投入。 作者提出了 **“/prewalk”**,这是一种基于“预填充”的更有效替代方案。与其生成静态文档,不如由前沿模型直接开始任务,进行初步探索,完成一次具体的代码修改,并初始化一份“待办事项”列表。随后,上下文被移交给一个更便宜、更快速的模型。 这种方法之所以更胜一筹,原因如下: 1. **效率:** 它消除了规划文档所需的冗余“重复阅读”。 2. **上下文:** 更便宜的模型继承的是真实的执行轨迹和进展,而非抽象的指令。 3. **减少作弊:** 通过在前沿模型处于“自信”探索阶段时将其终止,可以避免智能体在卡住时因绝望而产生的“作弊”(网络搜索)行为。 总之,“/prewalk”以极低的成本实现了接近前沿模型的性能,使其成为构建自主编程智能体的一种更快速、更可靠且更经济的方式。
ActPlane 论文探讨了 AI 编程助手接收的自然语言指令与操作系统层面可执行规则之间的“执行鸿沟”。尽管开发者会在 `CLAUDE.md` 等文件中编写详尽的指南,但大多数系统因缺乏上下文(如项目结构、时序逻辑),无法将模糊的要求转化为机器可评估的具体检查,从而导致这些指南难以被落实。
该研究分析了 64 个热门代码仓库中的 2,116 条指令,结果显示,83% 的策略属于“系统可观测”范畴,但仅有 45% 可以通过操作系统钩子直接强制执行。许多规则涉及跨事件逻辑,例如“提交前必须运行测试”,这需要追踪操作过程中的状态、顺序和血缘关系。
ActPlane 通过将自然语言策略编译为基于 eBPF 的执行引擎来弥合这一鸿沟。该系统利用时间门控和信息流标记在内核级强制执行规则,并在违规时向代理提供语义反馈。这种反馈至关重要:它使代理能够理解操作被拦截的原因并成功调整策略,从而在违规时的恢复率达到 97.7%。与传统的工具级或基于提示词的过滤器相比,ActPlane 能够捕获隐藏在子进程或中性入口点之后的操作,且性能损耗极低,显著提升了合规性。