每日HackerNews RSS

一二 UnoDOS 2 天前

UnoDOS 是一套多用途、契约驱动的图形化操作系统家族,旨在从老式 8 位家用电脑到现代 64 位个人电脑的各种设备上运行。该项目最初是为 IBM PC/XT 开发的紧凑型 16 位汇编语言操作系统,现已发展成为支持游戏主机、掌机及单板计算机的强大生态系统。 旗舰版本 **pc64** 可在现代 x86-64 硬件上实现裸机运行,并配备完整的图形化桌面、原生办公套件、网页浏览器、集成开发环境(IDE)及虚拟机管理程序。尽管平台各异,该系统通过名为“unodef”的共享契约保持统一体验,确保了小部件工具包、网络协议栈和媒体支持等功能在所有移植版本中的一致性。 UnoDOS 专为可移植性和透明度而设计,完全从零构建,不依赖 EDK2 等外部组件。它内置了用于安装、远程管理和无头测试的工具。无论是在 4.77 MHz 的 8088 处理器上,还是在现代笔记本电脑上运行,UnoDOS 都能提供高性能的原生环境。该项目采用开源协议(MPL 2.0),允许用户检查、修改并将该操作系统集成到更大的作品中。详细的文档和预构建镜像现已提供,可直接在真实或模拟硬件上使用。

第二次世界大战期间,德军使用恩尼格玛密码机发送加密信息。波兰、英国和法国的密码分析员利用该机器及其操作流程中的弱点,成功破译了截获的通讯。正在构建恩尼格玛密码机……输入了解恩尼格玛的历史

一场 Hacker News 讨论展示了 **enigma.design**:这是一个结合交互功能与历史资料的 3D 恩尼格玛机模拟器,使用 Astra 构建,并配有详细提示、参考图片和自定义检查工具。创作者通过剖面视图和电流流动可视化,清晰呈现了转子运动、线路连接及内部运作机制。 社区普遍称赞该项目的展示效果、准确性和教育价值。多名用户分享了其他恩尼格玛机模拟项目,并提出改进建议,包括提升移动端性能、让步骤切换更加流畅、支持在操作序列中向后浏览,以及加入适用于 AR/VR 的 WebXR 支持。 创作者计划进一步优化体验、添加 WebXR 功能,并在核实历史准确性后最终开源代码。另一场独立 debates 聚焦于 Show HN 是否要求公开源代码,尤其是对于借助 AI 完成的项目;最终的普遍结论是,发布一个可运行且内容实质的应用即可满足相关指南。 创作者还表达了一个更长期的目标:构建一款可在浏览器中运行、能够解密恩尼格玛机通讯的 Bombe。

此网站正在使用安全服务来保护其免受网络攻击。您刚才的操作触发了安全防御机制。触发此拦截的操作可能包括提交了某些特定的字词或短语、SQL 命令或格式错误的数据。

```Hacker News 的评论者就一则报道展开讨论:据称,NASA 曾私下询问前 SR-71A 机组人员,看是否有可能让这款飞机重新飞起来。许多人怀疑该项目的实用性:如今大多数侦察任务都由卫星和无人机完成,而现代制造业也能打造污染更少的后继机型。要让“黑鸟”重返天空,还必须重新制造已被销毁的工装,复原钛材和燃料生产体系、JP-7 燃料、发动机启动设备、维护程序,以及一支正在迅速老化的队伍所掌握的专门技术。 另一些人认为,这项努力能够保存有关持续以 3 马赫速度飞行、高空研究、模拟导航、材料和发动机等方面的宝贵知识。即使 SR-71 本身如今没有现实的军事任务,这些能力也可能让未来的高超声速项目受益。 讨论帖迅速被政治话题主导。有人猜测,此举反映了人们对特朗普时代的怀旧情绪、NASA 的预算博弈、 publicity,或是为了给更新的机密项目打掩护。总体而言,评论者对这款飞机怀有热情,但同时也质疑,重新建立其独特生态系统所需的高昂成本是否值得。 ``` I accidentally left publicity English due developer says Chinese. Need fix in```Hacker News 的评论者就一则报道展开讨论:据称,NASA 曾私下询问前 SR-71A 机组人员,看是否有可能让这款飞机重新飞起来。许多人怀疑该项目的实用性:如今大多数侦察任务都由卫星和无人机完成,而现代制造业也能打造污染更少的后继机型。要让“黑鸟”重返天空,还必须重新制造已被销毁的工装,复原钛材和燃料生产体系、JP-7 燃料、发动机启动设备、维护程序,以及一支正在迅速老化的队伍所掌握的专门技术。 另一些人认为,这项努力能够保存有关持续以 3 马赫速度飞行、高空研究、模拟导航、材料和发动机等方面的宝贵知识。即使 SR-71 本身如今没有现实的军事任务,这些能力也可能让未来的高超声速项目受益。 讨论帖迅速被政治话题主导。有人猜测,此举反映了人们对特朗普时代的怀旧情绪、NASA 的预算博弈、宣传目的,或是为了给更新的机密项目打掩护。总体而言,评论者对这款飞机怀有热情,但同时也质疑,重新建立其独特生态系统所需的高昂成本是否值得。 ```

请启用 JavaScript 和 Cookie 以继续。

Hacker News 用户讨论了 OpenAI 的 DevDay 2026 发布会 announcements。最受关注的是即将推出的 Decisions API:这是一款基于 Luna 的分类器,被视为对 TypeSafe 的 Jev 的快速回应。一位测试者称,批量调用 GPT-6 Luna 时,在成本为 Jev 的 1.2 倍的情况下,吞吐量约为后者的 1.6 倍。这引发了关于 OpenAI 定价、利润率以及 Jev 防御能力的讨论。 对于 Codex 新推出的 Cloud Agents、“Dots”编排工具、Slack 集成、订阅共享和安全扫描功能,用户反应明显两极:一些人认为这些功能实用,体验可与 Cursor 相比;另一些人则认为它们只是衍生品、过于复杂,或者演示效果不佳。 另一项主要批评涉及订阅调整。据称,新方案削减了 200 美元套餐的使用额度,同时增加了 500 美元档位,许多人将其视为“套路”,但也有人表示,补贴定价迟早必须结束。评论者还质疑发布会上以员工为主的人群所营造的热潮、缺少基准测试、Codex CLI 在 Windows 上的漏洞,以及 OpenAI 与 Hugging Face 之间的关系。

宇宙当前 · Belle Lune 2 正在加载… 🌍 地球☀️ 整个系统🔄 随地球旋转✂ 短视频这里什么都没有 拖动——旋转,滚轮——缩放,点击——卡片与轨道,双击——飞向天体。WASD——飞行,R/F——上升/下降,Q/E及方向键——转向,Shift——加速。点击组名称——高亮显示,👁——轨道 ✕ 数据已更新 () 刷新页面

**Show HN:包含 52.6 万颗小行星和所有已跟踪卫星的实时太阳系** 这是一个基于浏览器、按真实比例呈现的太阳系可视化项目。它融合了 CelesTrak 的卫星数据、JPL 的小行星和彗星目录,以及航天器状态向量,并每日更新。时间滑块支持向前或向后穿越时间,卫星会根据发射日期出现。 项目使用原生 WebGL2 和 Web Worker 构建,即使渲染约 52.6 万颗小行星,仍能保持流畅。顶点着色器每帧都为每颗小行星求解开普勒方程,使 CPU 基本处于空闲状态。距离和轨道位置均准确无误,但为了便于辨认,天体标记有所放大。 用户称赞了它的性能,以及地球轨道、小行星带、詹姆斯·韦布空间望远镜的 L2 晕轨道和帕克太阳探测器、欧罗巴快船等任务所带来的沉浸式可视化体验。讨论内容涉及星链占据主导地位、轨道碎片、小行星探测覆盖率和凯瑟勒综合征。 作者很快加入了星际天体搜索、键盘控制、移动端缩放修复、白色太阳,以及碎片轨道漏洞修复。功能请求包括支持 VR、更快的导航速度、更方便的天体居中功能,以及更清晰的实时控制。项目仅用几个晚上完成,目前尚未开源。

在以工程为主导的平台团队中,没有产品经理来决定路线图;相反,主任工程师必须通过寻找增值机会来“创造工作”。这需要从以下四个关键领域筛选信号: * **系统层面:** 利用事后复盘发现模式,通过分析云成本来指导“购买与自研”的决策,并解决内部繁琐工作以提高效率。 * **用户层面:** 进行持续的探索以发现持续存在的痛点,利用“超载用例”(用户为非预期目的而破解使用你的平台的情况)作为原型,并启动合作伙伴式的原型协作。 * **组织层面:** 监控迁移遗留问题以识别平台采用中的差距,并将管理层的关注点视为潜在信号,同时避免陷入“HiPPO”(薪酬最高者意见)的陷阱。 * **行业层面:** 使用描述性写作来重新评估遗留的设计决策,并通过观察行业趋势来利用“滞后套利”,即在无需支付创新成本的情况下采用成熟的解决方案。 主要的挑战不在于缺乏工作,而在于容易被“最响亮”的信号(如系统崩溃或高管反馈)所吸引,从而忽略了那些最具影响力的工作。有效的平台策略要求根据证据和准备周期来权衡这些信号,从而建立一个有意义且平衡的待办事项列表。

Hacker News 上的一篇讨论帖围绕《Staff Engineer 主动创造工作的指南》展开。文章认为,平台工程师通常拿不到明确路线图,因此需要主动从用户反馈、运营问题、组织协作阻力、成本和行业变化中发现需求。 许多评论者把“发明工作”理解为工程师凭空创建项目,并批评那些采用率低、依靠强制推行建设的内部平台。他们认为,平台团队应该像产品团队一样:了解内部客户,提供优秀的文档和稳定性,衡量实际影响,并通过自身价值吸引使用者,而不是强迫大家采用。有些人还建议,在构建广泛可复用的抽象之前,先使用新平台完成几个真实项目,以实际体验检验其效果。 支持者则表示,这个说法是一种带有幽默意味的简称,指的是需求工程和主动发现,尤其适用于 Staff Engineer 级别的工作。平台工作仍然可以通过提升可靠性、减少繁杂操作、降低成本和加快开发来改善业务。另一些人指出,无论是增加产品经理,还是只关注成本和事故,都无法解决优先级排序问题;直接调研客户、收集数据,并撰写清晰明确的提案,才是关键。多位评论者还批评了文章在立意和写作表达上较为含混。

TypeSafe 的 “Jev” 是一款专门用于将自然语言和应用程序状态转换为结构化、类型化决策的 AI 模型。与通用大语言模型不同,Jev 使用并行采样器和特定的训练方法,能够以高速、低成本的方式直接输出概率性的 JSON 数据。 尽管 Jev 在单次交互决策方面表现出色,但它目前缺乏原生的批量处理端点,因此在大规模数据工作流中需要进行昂贵的单次 API 调用。为弥补这一不足,作者开发了 “Jevaro” 代理服务器。它能够将多个请求合并处理,并将 Jev 的 JSON 输出转换为 Apache Arrow 格式。通过利用 Arrow,Jevaro 实现了高效的数据管道,使 Polars 和 DuckDB 等工具能够直接使用 AI 生成的决策,而无需进行 JSON 反序列化的额外开销。 作者建议 TypeSafe API 采用原生批量端点,直接返回 Arrow 数据流。这将消除“JSON 开销”以及重复网络调用带来的延迟,将瓶颈完全转移到推理阶段。在此之前,Jevaro 作为一种实验性接口,展示了将概率性 AI 决策集成到高性能结构化数据管道中的巨大潜力。

The Hacker News 的讨论考虑了 Jev 是否应使用 Apache Arrow 而不是 JSON。作者 explained,JSON 反序列化目前并非主要瓶颈;真正的问题是数千次 HTTP 往返请求——每个状态一次。批处理 API 可以在很大程度上消除这些开销,届时 Arrow 高效的列式序列化可能就会变得有价值。 评论者指出,示例使用长连接 HTTP/2 和 Arrow IPC,这可能是一种务实的解决方案。他们还澄清,gRPC 和 Arrow IPC 的用途不同:gRPC 是 RPC 框架,而 Arrow IPC 是一种序列化格式。Arrow Flight 将两者结合起来,但会增加复杂性,并降低浏览器兼容性。作者最终承认,自己此前混淆了 Arrow IPC 和 Arrow Flight。

一个以 **TurboGPT** 为中心的 Hacker News 讨论项目。该项目受 minGPT 启发,据说只需 13 秒就能训练出一个仅 **22 KiB** 的 Transformer。它是一个字节预测器,可以在任意文件上进行训练,需要 **CUDA 13.4**,并且目前只提供了适用于 **Windows** 的构建脚本。 一些评论者质疑再做一个极简 GPT 实现的动机,认为 Karpathy 的 nanoGPT 或 minGPT 等项目已经具有更高的教育价值。另一些人则表示,这类项目可能是为了娱乐、给简历增添亮点,或只是因为人们喜欢反复实现熟悉的工具;还有人调侃,它很可能依赖 AI 生成的代码。 作者解释说,minGPT 适合用来学习 Transformer 架构,但在家里进行更大规模的实验需要更高的速度。TurboGPT 提供了一种快速测试架构想法的方法,尤其是当这些想法尚无经过优化的训练原语时;不过作者也承认,这种速度可能已经有些 overkill。 评论者还注意到,如今人们倾向于按照模型序列化后的文件大小,而不是参数数量来命名模型;有人甚至提出,在如此小的规模下,模型优化或许可以直接求解。

**livenerf** 是一个开源、仅限追加的基准测试项目,旨在确定 AI 模型(特别是 Claude Opus 3.5)在发布后是否会出现性能“漂移”(即“削弱”)。尽管坊间常有传闻称模型随时间推移性能下降,但相关讨论往往沦为缺乏依据的“主观感官”。livenerf 提供了一种严谨且数据驱动的替代方案。 该项目使用了一个包含 2,300 多个问题的锁定校准面板(涵盖 GPQA、MMLU-Pro 和数学题),这些问题因其“有时正确”的难度而被选中,从而确保了极高的统计灵敏度。为消除混杂变量,该基准测试采用了以下措施: * **严格的封闭性**:冻结提示词、固定 CLI 版本以及确定性的评分机制。 * **预注册协议**:所有指标、决策规则和验证标准均提前记录,以防止“P-hacking”(数据操纵)。 * **统计严谨性**:分析遵循 Anthropic 提出的“在评估中增加误差线”的方法,通过聚类标准误来衡量成对的逐项得分差异。 该基准测试在 30 天的时间窗口内跟踪准确率和输出 Token 数量(这是衡量“懒惰”的关键指标)。通过将实时结果与发布首周的基准进行对比,livenerf 旨在用透明、可验证的模型性能时间序列来取代猜想。

Hacker News 的讨论围绕 AI 提供商是否会在模型发布后故意降低模型质量展开。LiveNerf 被介绍为一种用于检测模型随时间变化的统计基准:它通过每日采样、滚动 10 天窗口、聚类误差估计以及预先注册的阈值来进行评估。 怀疑者认为,人们感知到的模型“削弱”通常源于蜜月效应、预期不断提高、非确定性、任务难度增加,或提示词、上下文和智能体框架的变化。坚定相信这种情况的人则报告称,模型质量会在发布后、接近使用高峰时,或接近配额限制时下降,并怀疑提供商暗中调整流量路由、减少推理投入、进行量化处理,或采取其他节省成本的措施,尤其是在补贴订阅中。 几位参与者提到了已确认的 Claude 相关事件,涉及基础设施、缓存、推理强度或智能体框架回归;但他们强调,这些属于缺陷或产品变更,并不能证明模型权重被有意降级。据报道,API 用户和企业用户通常会获得更稳定的表现。 这项基准本身也受到批评:它推出时间太短,可能受到客户端或模型变化的干扰,容易被提供商识别,而且无法证明模型内部究竟发生了什么。总体而言,讨论几乎未能找到 AI 提供商故意“削弱”模型的明确证据,但参与者对不透明的提供商做法存在相当大的不信任。

更多

联系我们 contact @ memedata.com