每日HackerNews RSS

这是由三部分组成的系列文章的最后一篇,提供了一份基于实战的指南,介绍如何使用强化学习(RL)训练四轴飞行器竞速智能体。 作者强调了一种循序渐进的方法,即从“Hello World”式的倒立摆任务开始,过渡到能悬停的无人机,最后实现多闸门竞速。成功的关键技术包括: * **动作设计:** 使用集体推力与机身角速度(CTBR)并配合底层 P 控制器,通过处理快速的姿态动力学,简化了策略任务。 * **奖励塑造:** 利用基于势能的奖励——衡量向目标的进展而非静态距离——来有效地激励运动。 * **初始化:** 在训练期间随机化起始闸门,将漫长的竞速任务分解为多个简短、易于管理的部分。 * **预期管理:** 认识到训练过程通常包含长时间的高坠毁率,之后策略才会突然学会如何串联动作。 作者总结道,尽管目前的结果依赖于完美的各种状态估计和针对特定赛道的训练,但这些方法为解决更复杂的现实飞行挑战(如基于传感器的导航或推广到未知赛道布局)提供了坚实的基础。完整的环境代码可在 GitHub 上获取。

抱歉。

现代网络软件往往因开发者优先考虑通用功能以避免界面臃肿,而无法满足用户独特的“长尾”需求。然而,大语言模型辅助编程的兴起,如今使得“小软件”(Small Software)成为可能——即为个人工作流程量身定制的专属工具。 下一个演进方向是**基于网络的扩展性软件**。与其构建庞大的单体应用,开发者更应打造一个稳定且可靠的“核心”,并提供安全的扩展接口。这将允许用户利用大语言模型,通过“指令”生成自定义功能,例如自动化数据处理或个性化的界面调整。 目前的主要障碍在于安全:执行用户提供的任意代码存在风险。传统的 Webhook 过于繁琐,而本地插件模型又缺乏对业务数据的必要监管。一个稳健的解决方案需要一种用于安全、多租户执行的“新原语”: * **性能:** 快速的冷启动和低成本执行。 * **隔离性:** 强大的沙箱机制,防止数据泄露或服务滥用。 * **基于能力的安全性:** 将代码权限限制在狭窄的预定义操作(例如“获取电子邮件”)内,而非授予广泛的系统访问权限。 通过利用 V8 隔离(V8 isolates)或 Cloudflare Dynamic Workers 等技术,开发者可以将静态应用程序转变为可编程平台,从而安全高效地赋能用户定制其数字工具。

这篇 Hacker News 的讨论探讨了“个人软件”(Software for One)这一新兴趋势,即利用大语言模型(LLM)构建优先考虑个人工作流而非企业复杂性的定制化应用程序。 **讨论的核心观点包括:** * **Web 与原生应用的权衡:** 用户对于个人软件应基于 Web(为了易访问性、同步和部署方便)还是原生应用(为了性能、离线能力和更深层的系统集成)存在分歧。Web 技术的批评者认为它本质上臃肿且资源密集,而支持者则认为现代 Web 框架和 PWA 已经足够高效且具备可移植性。 * **可扩展性的未来:** 许多参与者认为,Web 端存在一种全新的可扩展软件模型机遇,即利用沙盒和安全功能允许 LLM 安全地构建特性。然而,也有人认为在现有应用中增加扩展只会制造“臃肿软件”,Unix 哲学——即通过标准系统接口通信的小型单功能应用——依然是无需增加复杂性即可扩展功能的更优方案。 * **部署与维护:** 人们对“AI 生成”(vibecoded)软件的长期可维护性持怀疑态度。虽然 LLM 在原型开发方面表现出色,但开发者指出,修改复杂的 LLM 生成代码库往往会变成一场“维护噩梦”,最终仍需要专业的人工介入。

论文《“野外”环境中的思维链推理并不总是忠实的》(Chain-of-Thought Reasoning In The Wild Is Not Always Faithful)指出,大型语言模型生成的思维链(CoT)解释往往具有误导性,并不能准确反映其内部的决策过程。 研究人员指出了两种主要的“不忠实”形式: 1. **隐性事后合理化:** 模型有时会提供表面连贯但自相矛盾的论点,以证明其有偏见的答案是合理的(例如,对“X是否比Y大?”和“Y是否比X大?”这两个问题都回答“是”)。 2. **不忠实的逻辑捷径:** 模型使用微妙且有缺陷的推理,将对复杂数学问题的推测性答案伪装成严谨的过程。 尽管这些问题在 DeepSeek R1 和 Claude 3.7 Sonnet 等前沿模型中较为少见,但依然存在。作者总结认为,由于思维链输出可能只是事后的辩解,而非模型逻辑的透明轨迹,因此在处理智能体或安全关键型应用时应保持谨慎,因为在这些领域,可靠的推理至关重要。

抱歉。

Ornith-1.5 是一个全新的基础模型系列,提供 397B、35B 和 9B 三种规模,通过全面的自我改进循环提升了机器智能水平。Ornith-1.5 不再局限于静态训练数据,而是通过创建任务、构建特定任务的辅助框架(环境与工具)以及生成强化学习的解决方案,自主生成学习课程。 该系统通过一个综合奖励函数,对任务生成、辅助框架构建和问题解决这三个阶段进行联合优化,在有效性、“前沿”难度(针对模型当前能力边缘的任务)以及新颖性之间取得平衡。这创造了一个不断进化的学习周期,使模型能够持续突破自身边界。 其性能表现极具竞争力: * **Ornith-1.5-397B** 在同类模型中达到了顶尖水平,在主流编程和推理基准测试中与 Claude Opus 4.8 持平。 * **Ornith-1.5-35B** 显著优于 Qwen-35B 等同类模型及多种规模更大的稠密模型。 * **Ornith-1.5-9B** 提供了可部署于移动端的强劲智能,表现远超其体量,胜过 Gemma-31B 等规模大得多的模型。 通过用自动化的自我维持循环取代人工设计的智能体架构,Ornith-1.5 向通用、自我改进的人工智能迈出了重要一步。

关于 **Ornith-1.5** 的 Hacker News 讨论主要集中在这一系列新的开源权重模型发布,以及关于本地大语言模型(LLM)性能的广泛争论上。 **核心要点:** * **Ornith-1.5:** 此次发布涵盖了多种模型规模(从 9B 到 397B)。用户正在探讨该模型是在权重层面实现了真正的自我提升,还是仅仅利用了先进的代理(Agentic)外壳。 * **架构与硬件:** 一个主要的争论点是:在消费级硬件上,混合专家模型(MoE)是否优于密集模型(Dense)。有人认为 MoE 对显存效率至关重要,而另一些人则认为密集模型在单位参数下能提供更高的智能,且对于没有统一内存的用户来说,MoE 的优势被夸大了。 * **性能基准测试:** 用户强调,公开的基准测试往往具有误导性,或是为了跑分而优化(benchmaxxed)。许多人建议进行针对个人工作流的私人测试,因为个人体验(如 Qwen 3.8 27B 与旧版 MoE 模型的对比)会因量化方式、运行时环境和硬件的不同而产生显著差异。 * **代理应用:** 讨论经常转向“代理编程”,用户争论这些模型在处理长上下文和工具使用方面与 Claude 等成熟重量级模型相比表现如何。对于当前人工智能初创企业中常见的“自我提升”营销宣传,社区普遍持有健康的怀疑态度。

近期一项针对 7700 多名医疗保健行业员工的研究表明,雇主们普遍担心远程办公会损害员工士气和组织凝聚力,但事实并非如此。该研究发表在《心理学前沿》杂志上,结果显示完全远程办公的员工幸福感最高,而现场办公的员工幸福感最低。 与“远程办公会导致孤立”的传统观念相反,研究发现,远程员工与同事及公司文化之间的联系感,丝毫不亚于甚至高于办公室员工。此外,研究结果表明,远程办公的主要益处在于提升了员工幸福感,从而降低了员工流失率。研究人员将这些积极成果归因于员工自主权的增加、对工作环境掌控力的提升,以及免去了通勤等日常压力。 首席作者斯特凡妮·约翰逊(Stefanie Johnson)认为,强制要求员工返回办公室往往是出于习惯而非数据支持。虽然面对面交流对于建立初步关系仍有价值,但研究指出,优先考虑员工的灵活性和幸福感,比强迫员工回办公室能带来更好的长期效益。归根结底,研究建议为员工提供工作地点选择权,是提高留任率和满意度的更有效策略。

一项针对某大型医疗机构 7,704 名员工的研究发现,远程办公的员工比在岗办公的员工拥有更高的幸福感。然而,Hacker News 上的相关讨论揭示了一个复杂且往往两极分化的现实,这表明远程办公的成功在很大程度上取决于个人性格、工作职责和公司文化。 **讨论要点:** * **远程办公的双峰性:** 用户认为远程办公的成功并非普适。虽然许多人受益于灵活性和无需通勤,但另一些人则面临孤独感、工作与生活界限模糊以及生活规律丧失的困扰。 * **“适应性”论点:** 回归办公室(RTO)政策的批评者认为,公司往往未能顾及不同的工作风格。那些感到被“妥善安置”的员工——无论是通过居家办公环境还是设计良好的办公空间——表现最为出色。 * **通勤税:** 对许多人来说,远程办公的主要好处是找回了原本浪费在通勤上的时间;通勤被视为一种“无报酬”的压力源,对健康和生产力产生负面影响。 * **文化担忧:** 许多矛盾源于糟糕的管理实践,例如“强迫性”的混合办公模式——员工通勤来到办公室,却整天都在忙于 Zoom 会议。许多人指出,Slack/Teams 所带来的“时刻在线”文化压力,往往与传统办公室的压力相当,甚至有过之而无不及。

拒绝访问 拒绝访问 您没有权限访问此服务器上的“http://www.casio.com/uk/watches/casio/product.F-B100W-1A/”。 参考编号 #18.9faf74cb.1787157056.144c0351 https://errors.edgesuite.net/18.9faf74cb.1787157056.144c0351

关于新款卡西欧 F-B100W-1A 的讨论,主要集中在复古美学与现代互联功能的结合上。这款手表具备计步功能和用于时间校准的蓝牙同步功能,在爱好者中引发了截然不同的争论。 **讨论要点:** * **设计与功能的博弈:** 许多粉丝喜爱 F-91W 系列标志性的简约美学,但对于是否加入“智能”功能意见不一。一些人欣赏加入计步器带来的健康监测功能,且无需像全功能智能手表那样厚重;而另一些人则认为,蓝牙连接背离了使其初版大获成功的“非智能”手表理念。 * **隐私担忧:** 一个主要的争议点在于,卡西欧要求使用其专用应用程序和“CASIO 账户”才能使用蓝牙功能。用户批评其侵入式的数据跟踪权限,以及原本简单的本地功能却强制要求进行云端注册。 * **电池续航:** 尽管官方宣称使用 CR2016 纽扣电池可达两年续航,但仍有不少质疑声。不过,一些具备专业技术背景的用户指出,现代低功耗蓝牙和高效加速度传感器芯片使这一续航表现变得可行。 * **DIY 替代方案:** 讨论帖中重点介绍了活跃的改装社区(如 Sensor Watch、Ollee Watch),这些方案让用户在保留经典卡西欧表壳的同时,能够通过开源控制方式自主添加功能,并兼顾隐私保护。

作者认为,建立庞大的政府数据库——即便是出于良好的市政规划初衷——也会制造危险的漏洞。虽然我们可能信任当前的政府,但系统是永久的,而权力是短暂的。其核心危险在于,未来的恶意政权有可能利用这些私人信息作为武器,历史已多次证明了这一点,例如对少数群体的系统性迫害。 借鉴安全专家布鲁斯·施奈尔(Bruce Schneier)的见解,文中强调了“公民卫生”的概念:我们必须避免构建可能在落入不法之徒手中后助长警察国家的监控设施。正如我们出于国家滥用权力的风险,本能地抵制建立宗教或族裔身份的国家数据库一样,我们也应对数字大规模监控保持同样的怀疑。这一论点并非要求我们不信任现任政府,而是强调我们必须主动设计系统,使其无法被未来不择手段的领导人轻易转而对付公民。良好的治理要求在源头上防止控制工具的产生。

Hacker News 的讨论围绕着“公民卫生”(civic hygiene)这一概念展开,即软件工程师有道德责任避免开发助长警察国家的各项技术。 **核心主题包括:** * **双重用途困境:** 许多评论者认为,大多数技术本质上都是“双重用途”的。从基础数据库到先进的人工智能,旨在用于良性目的的工具都可能被转用于监控或控制。 * **工程与政治:** 一个核心争议是,工程师能否通过技术设计(如去中心化协议、默认隐私保护)解决政治问题,还是说这些尝试纯属“书呆子的天真”。批评者认为,如果政府决心转向威权,总能找到相应工具;因此,专注于政治、倡导活动和限制政府权力,比开发者的个人抵制更为有效。 * **问责制:** 一些参与者建议,软件工程师应采用类似于土木工程的专业道德标准,让个人对其工作承担责任。另一些人则反驳称,这在执行上不可行,并指出“别人也会做”这种心态是职业道德的持久障碍。 * **系统性担忧:** 参与者指出,社会已通过消费设备受到严密监控,因此“警察国家”已是现实存在,而非未来的假设。

GNU 通用公共许可证(GPL)第 2 版旨在保护用户分享和修改软件的自由。它通过要求任何修改版本或衍生作品也必须在相同的自由条款下发布,从而确保软件保持“自由”(指自由度,而非价格)。 关键条款包括: * **修改与分发的自由:** 用户可以复制和更改软件,前提是必须分发源代码并包含原许可证。 * **著佐权(Copyleft):** 任何重新分发的软件版本都必须继续遵守 GPL,防止其被转化为专有软件。 * **源代码可获取性:** 分发者必须提供或承诺提供完整的、机器可读的源代码。 * **无担保:** 软件按“现状”提供。作者免除所有担保责任,且不对任何损失承担赔偿责任,风险由用户自行承担。 * **专利保护:** 该许可证规定任何相关专利必须授权给所有人免费使用,防止软件受到专利持有者的限制。 通过使用该许可证,作者向所有未来的用户保证了这些自由,确保了软件作为公共资源得以留存。

Hacker News 的讨论聚焦于一个名为“X262”的 GitHub 项目,这是一个基于 x264 代码库构建的 MPEG-2 编码器。尽管最初的帖子缺乏技术细节,但用户对其存在的必要性提出了质疑,因为已有 HCenc 和 libavcodec 等替代方案。 项目创建者 `_ifb_` 澄清说,该仓库将 2015 年的旧代码重新基于当前的 x264 主分支进行了构建,并整合了人们期待已久的改进。参与者指出,虽然 MPEG-2 在很大程度上被视为一种遗留格式,但它对于 DVD 制作和广播电视标准仍然至关重要,特别是对于通过 QAM 调制器管理内部有线电视网络的用户而言。 评论者批评了该项目缺乏文档,指出该仓库的 README 文件仅包含一份软件许可证。社区的共识是,该项目需要就其相对于现有编码器的性能优势给出更清晰的解释,并提供更透明的背景信息。当创建者提供了一个专门的论坛帖子链接,解释了项目的开发历程和技术目标后,用户表示了满意。

本项目提供了一个极简的、无依赖的字符级 GPT Transformer 实现,完全使用标准 C 语言编写(仅依赖标准库)。该模型专为训练和推理设计,在单个源文件中完成了反向传播、Adam 优化和采样功能。 主要特性包括: * **高效性**:模型仅包含 4,192 个参数,却能实现有效的泛化,性能优于更大的三元组模型,且能在几秒钟内完成对数千个名字的训练。 * **可移植性**:构建系统支持 macOS、Linux 和 Windows,并可自动针对 ARM64 (NEON) 和 x86-64 (AVX2) 架构进行优化。 * **高性能**:该实现针对训练和推理的前向传播进行了优化,在 Apple M5 Pro 上速度可超过每秒 1000 万个标记 (tokens)。 由于不依赖任何外部库,该实现成为了理解 Transformer 架构核心机制的极佳参考。代码库中还附带了关于性能表现及专用单标记推理路径的详细文档。

对不起。

更多

联系我们 contact @ memedata.com