这是由三部分组成的系列文章的最后一篇,提供了一份基于实战的指南,介绍如何使用强化学习(RL)训练四轴飞行器竞速智能体。
作者强调了一种循序渐进的方法,即从“Hello World”式的倒立摆任务开始,过渡到能悬停的无人机,最后实现多闸门竞速。成功的关键技术包括:
* **动作设计:** 使用集体推力与机身角速度(CTBR)并配合底层 P 控制器,通过处理快速的姿态动力学,简化了策略任务。
* **奖励塑造:** 利用基于势能的奖励——衡量向目标的进展而非静态距离——来有效地激励运动。
* **初始化:** 在训练期间随机化起始闸门,将漫长的竞速任务分解为多个简短、易于管理的部分。
* **预期管理:** 认识到训练过程通常包含长时间的高坠毁率,之后策略才会突然学会如何串联动作。
作者总结道,尽管目前的结果依赖于完美的各种状态估计和针对特定赛道的训练,但这些方法为解决更复杂的现实飞行挑战(如基于传感器的导航或推广到未知赛道布局)提供了坚实的基础。完整的环境代码可在 GitHub 上获取。
现代网络软件往往因开发者优先考虑通用功能以避免界面臃肿,而无法满足用户独特的“长尾”需求。然而,大语言模型辅助编程的兴起,如今使得“小软件”(Small Software)成为可能——即为个人工作流程量身定制的专属工具。
下一个演进方向是**基于网络的扩展性软件**。与其构建庞大的单体应用,开发者更应打造一个稳定且可靠的“核心”,并提供安全的扩展接口。这将允许用户利用大语言模型,通过“指令”生成自定义功能,例如自动化数据处理或个性化的界面调整。
目前的主要障碍在于安全:执行用户提供的任意代码存在风险。传统的 Webhook 过于繁琐,而本地插件模型又缺乏对业务数据的必要监管。一个稳健的解决方案需要一种用于安全、多租户执行的“新原语”:
* **性能:** 快速的冷启动和低成本执行。
* **隔离性:** 强大的沙箱机制,防止数据泄露或服务滥用。
* **基于能力的安全性:** 将代码权限限制在狭窄的预定义操作(例如“获取电子邮件”)内,而非授予广泛的系统访问权限。
通过利用 V8 隔离(V8 isolates)或 Cloudflare Dynamic Workers 等技术,开发者可以将静态应用程序转变为可编程平台,从而安全高效地赋能用户定制其数字工具。
Ornith-1.5 是一个全新的基础模型系列,提供 397B、35B 和 9B 三种规模,通过全面的自我改进循环提升了机器智能水平。Ornith-1.5 不再局限于静态训练数据,而是通过创建任务、构建特定任务的辅助框架(环境与工具)以及生成强化学习的解决方案,自主生成学习课程。
该系统通过一个综合奖励函数,对任务生成、辅助框架构建和问题解决这三个阶段进行联合优化,在有效性、“前沿”难度(针对模型当前能力边缘的任务)以及新颖性之间取得平衡。这创造了一个不断进化的学习周期,使模型能够持续突破自身边界。
其性能表现极具竞争力:
* **Ornith-1.5-397B** 在同类模型中达到了顶尖水平,在主流编程和推理基准测试中与 Claude Opus 4.8 持平。
* **Ornith-1.5-35B** 显著优于 Qwen-35B 等同类模型及多种规模更大的稠密模型。
* **Ornith-1.5-9B** 提供了可部署于移动端的强劲智能,表现远超其体量,胜过 Gemma-31B 等规模大得多的模型。
通过用自动化的自我维持循环取代人工设计的智能体架构,Ornith-1.5 向通用、自我改进的人工智能迈出了重要一步。