**Read the Tape** 是一项日常交易挑战,通过游戏化的盲测图表界面来测试您的市场直觉。每天,用户会看到五张图表,并需预测价格走势是“上涨”还是“下跌”。 参与者拥有 10,000 美元的虚拟资金,并通过设置“信念等级”(低、中或高)来决定每笔模拟交易的下单金额。该游戏会追踪个人的连胜记录和职业生涯表现,让用户能够挑战好友并分享战绩。 该平台的一大特色是其基准评估:所有用户的表现都会与“猴子指数”(Monkey Index)进行对比。这是一个讽刺性的、无信息的基准,代表纯粹随机的市场结果。作为一种类似应用程序的体验,*Read the Tape* 提供了一个无风险的环境,供您练习创造超额收益并提升技术分析能力。
构建机器人数据平台需要处理复杂的多模态数据集——包括同步的摄像头画面、关节状态和传感器数据流——这些数据在训练过程中必须保持绝对同步。Pareto 团队最初认为这是一个小众问题,但他们发现其核心基础设施需求与全球视频平台非常相似:即可靠的上传、后台处理、元数据索引和高效的流式传输。
通过将机器人数据集视为一种特殊的视频内容,该团队应用了经典的系统设计模式,例如存算分离、使用持久化工作流处理长时间运行的任务,以及将元数据与原始媒体分离。Pareto 利用 Temporal 等工具进行稳健的作业管理,并使用 LanceDB 进行多模态向量搜索,使用户无需下载海量文件即可预览同步数据并筛选用于机器人学习的片段。
至关重要的是,Pareto 优先考虑架构的结构完整性,而非过早地追求扩展。它采用模块化和可自托管的设计,允许用户从简单的命令行界面(CLI)设置起步,并根据需要扩展至分布式处理。通过专注于持久性和高效的数据检索而非单纯的数据量,Pareto 为现代机器人学习基础设施的独特挑战提供了一种实用的开源解决方案。
Poolside 发布了 **Laguna S 2.1**,这是一款拥有 1180 亿参数(80 亿激活参数)的混合专家模型(MoE),专为长周期智能体编程任务而设计。该模型支持 100 万 token 的上下文窗口,研发耗时不到九周,在 Terminal-Bench 2.1 和 DeepSWE 等基准测试中表现出色,性能优于许多规模更大的模型。
Laguna S 2.1 性能的核心在于其“思维”能力,这使模型能够利用推理时计算(test-time compute)来验证工作、回溯步骤,并在复杂的工程挑战中保持韧性。在案例研究中,该模型成功从零构建了一个浏览器引擎,优化了智能体架构的性能,并独立推导出了一个关于埃尔德什(Erdős)数学问题的无穷解族。
该模型标志着研究重点从单纯的参数规模扩张转向行为能力的改进,例如增强验证和持续性。Poolside 以 OpenMDW-1.1 许可协议发布了模型权重,并提供了完整的评估轨迹以确保透明度。目前,该模型可通过 API、本地部署(Ollama、vLLM 等)以及网页端 chat.poolside.ai 使用。Poolside 正在将这些开发技术应用于一款目前处于预训练阶段的、更大规模的新模型中。