Kapa 构建了私有的**公司知识基准**,其中包含 1,000 条真实生产查询、历史语料库快照,以及用于检索最小完整权威信息块集的评判标准。由智能体生成的标签经过了 170 个人工标注案例的验证。 使用相同数据测试了七种检索器: - 混合搜索:**0.41**,0.4 秒 - 混合搜索 + 重排序:**0.50**,0.7 秒 - 查询分解:**0.56**,1.8 秒 - Kapa Default:**0.61**,3.3 秒 - 智能体 grep:**0.54–0.61**,13–17 秒 - Kapa Deep:**0.65**,5.1 秒 重排序是传统方法中成本最低的改进方案。智能体 grep 的效果与优化后的固定流程相当,但速度慢得多,每次查询约返回 40,000 个词元,成本也高得多。Kapa Deep 得分和精确度最高,同时每次查询仅返回约 5,000 个词元,因此是下游智能体使用成本最低的结果。 作者指出,所有受测检索器均由 Kapa 构建,因此该基准和测试结果可能存在产品偏差。
**agent-wow** 是一个用于评测《魔兽世界》中前沿大语言模型智能体的实验平台。智能体通过 WoW 网络协议直接连接到私有的 AzerothCore 服务器,并可自行构建模块,而不必依赖预定义的移动、战斗或交互机制。
在初步测试中,使用 GPT-6 Astra 的 Codex 被要求创建一名兽人角色,并完成起始区域的所有任务。它在 40 分钟内完成了任务,且全程没有死亡。它通过分析 AzerothCore 数据来获取任务要求和地点,优化任务顺序与技能配置,并生成协议桥接工具来交换和解码游戏数据包。它还利用服务器的导航网格编写了一个基于 C++ Detour 的寻路工具,不过偶尔会利用碰撞漏洞穿墙移动。
该项目旨在通过难度逐步提升的内容,测试智能体的长时程规划和实时战术执行能力,最终让服务器中充满智能体,并攻略冰冠冰川。未来工作包括实现自主升级至 80 级、多人协作、更完善的可观测性,以及通过沙箱限制不安全的服务器访问。