每日HackerNews RSS

**ProgramBench Vetted** 是一项经过强化的基准测试,包含 50 个任务,旨在评估 AI 智能体从已编译的“封装”二进制文件中重构功能性代码库的有效性。与前代产品不同,它专注于**难度校准**,确保评分能准确反映模型通过实验推理逻辑的能力,而非利用测试套件的缺陷。 ### 核心特性 * **挑战内容:** 智能体将获得一个二进制文件、使用文档和一个 Shell 环境(无互联网)。它们必须探测二进制文件、推测其行为,并编写一个能通过一系列行为测试的替代代码库。 * **严格流程:** 任务经过多轮自动化及人工验证。专门的“评审”和“纠错”智能体会审计环境泄露、重复测试以及“捷径”式解决方案(例如调用已安装的系统库而非编写代码)。 * **公平性:** 该基准测试旨在奖励有意义的局部进展,而非“全有或全无”的成功,从而防止模型仅通过复现浅层的命令行界面来获取高分。 ### 核心意义 ProgramBench Vetted 通过测试智能体协调长期任务的能力,解决了“记忆悖论”。即便模型在预训练数据中见过目标程序,它仍需展示出正确进行逆向工程与逻辑实现的能力。

抱歉。

TigerBeetle 采用“协议感知确定性模拟测试”(Protocol-Aware Deterministic Simulation Testing, DST)来确保其分布式数据库的可靠性。传统的黑盒测试(如 Jepsen)是从外部对系统进行测试,而 TigerBeetle 则采用“由内而外”的测试方法。 通过利用逻辑和物理确定性,该数据库在一个名为 VOPR 的模拟器中运行,其中时间以及存储和网络等外部交互均可完全控制。这使开发人员能够在一个进程内以极高的速度探索庞大的状态空间,从而模拟崩溃、网络分区和数据损坏等情况。 至关重要的是,由于模拟器具备协议感知能力,它能够深入洞察各个副本的状态。它强制执行以下约束: * **安全性不变量:** 验证共识协议和存储引擎(LSM 树)在所有副本间保持逐字节的一致性。 * **活性不变量:** 确保副本即使在复杂的恢复场景下,也能有效地将本地和全局持久性转化为可用性。 通过检查这些内部属性,TigerBeetle 超越了简单的系统级断言,使开发人员能够捕获细微的 Bug,验证复杂的恢复协议,并以绝对可复现的精度对优化效果进行基准测试。这种方法将那些“难以调试”的分布式场景转化为了可控且快速的测试用例。

抱歉。

跳至测试 正在加载…… 此测试需要 JavaScript 来记录答案并计算分数。 关于本实验

抱歉。

**zcomplete** 是一款轻量级、高性能的命令行工具,适用于 Zsh、Bash 和 Fish,可实时纠正输入错误的命令。 **主要特性:** * **智能纠错:** 能够针对拼写错误(例如 `gti` → `git`)、前缀错误(`mkd` → `mkdir`)以及子序列匹配提供修正建议。它会根据你的历史记录和使用模式进行学习,并按频率和近期使用情况对命令进行排序。 * **安全至上:** 内置“危险命令”列表(如 `rm` 或 `git reset --hard`),执行时需用户明确确认。用户可设置模式:`safe`(默认)、`unsafe` 或 `bypass`。 * **高性能:** 使用 Rust 编写,运行速度极快,对 Shell 响应时间的额外开销小于 1 毫秒。 * **兼容性与隐私:** 支持 Linux 和 macOS (arm64/x86-64),无需复杂配置,且所有数据均保存在本地(无任何数据上传)。 * **简易安装:** 通过单条 Shell 命令即可安装。它能无缝集成且不会覆盖现有配置,并完全兼容你的 Shell 环境。 无论你是要修复简单的拼写错误还是复杂的子命令,zcomplete 都能通过学习你的习惯来节省时间,在确保持续工作流的同时,为可能具有破坏性的命令提供一道安全防线。

抱歉。

请启用 JavaScript 和 Cookie 以继续。

这篇 Hacker News 的讨论围绕着一项关于气候变化经济影响的研究展开。该研究因使用了乌兹别克斯坦极端的异常数据而失效,最终遭到撤稿。评论者指出,研究人员原本的图表通过截断坐标轴掩盖了这些异常值,引发了人们对于这是由于严重失职还是蓄意数据造假的质疑。 讨论突显了学术研究中“数据完整性”的更广泛问题。参与者认为,单个错误的数据点可能会在元分析中产生连锁反应并影响政策,形成难以遏制的“引用惯性”。虽然一些用户认为 AI 工具最终有助于自动标记此类异常,但也有人指出 AI 同样可以被用来大规模生成误导性内容。 该帖还涉及了“人工垃圾内容”的挑战,即那些未被核查的过往偏见或欺诈性数据。归根结底,这场对话强调了建立更好的可重复性标准和自动化数据验证机制的迫切需求,以防止有缺陷的研究在科学文献和公众舆论中根深蒂固。

``` tode 打开当前文件夹 tode <文件夹> 打开指定文件夹 tode <文件> 打开指定文件 tode --goto <文件:行:列> 在指定行和列打开文件 tode --diff <a> <b> 比较两个文件 tode --split right 在右侧拆分终端窗格中打开 terminal-code tode --review 在源代码管理面板中打开 tode --import 从兼容 vscode 的编辑器中导入设置、快捷键、代码片段和扩展 tode --shortcut-setup 解决 terminal-code 与当前终端之间的快捷键冲突 tode --upgrade 将 terminal-code 升级到最新版本 ```

抱歉。

传统芯片每秒在处理器和内存之间传输数据数十亿次,大部分能量都消耗在数据搬运而非计算上。这是一个 80 年来从未被行业质疑过的架构缺陷。Mythic 做到了。我们将人工智能模型权重存储在闪存内,并在源头直接进行模拟计算,从根源上消除了这种浪费。

关于 Mythic 模拟存内计算(CiM)架构的 Hacker News 讨论,主要集中在对其应用于大语言模型(LLM)的技术可行性的怀疑上。 尽管参与者承认,与数字算术逻辑单元(ALU)相比,该架构在能效上具有 100 倍至 1000 倍的提升潜力,但他们对制造差异性、噪声以及扩展至万亿参数模型所面临的困难表示了深切忧虑。批评者指出,Mythic 目前的芯粒仅能处理 3000 万至 8000 万个参数,这意味着若要运行现代大语言模型,则需要数千个裸片,这会造成巨大的物流和架构障碍,特别是在键值(KV)缓存管理和数据吞吐量方面。 讨论的很大一部分围绕着缺乏公开、独立的基准测试,以及该公司经常被指为人工智能生成的营销材料不够透明。虽然一些工程师认为模拟原理是合理的,且通过将模型针对特定硬件进行重调等补偿技术可以减轻可靠性问题,但其他人仍持怀疑态度。目前的共识是,虽然模拟计算是克服冯·诺依曼瓶颈的一种引人注目的替代方案,但 Mythic 面临着严峻的经济和工程挑战,许多人质疑他们能否真正与英伟达等数字解决方案的快速扩张相抗衡。

作者分享了他们构建的一款康威生命游戏(Conway’s Game of Life)定制触觉硬件项目。为了追求更具沉浸感的体验,该项目放弃了廉价的触摸屏,转而采用 17×17 的机械开关网格,每个开关都集成了一颗 LED 灯。 该设备由 AVR128DA64 微控制器驱动,采用多路复用显示方案,并利用 MOSFET 来处理 LED 所需的高电流脉冲。其界面直观,用户可以通过拨动开关来绘制图案,同时通过模拟电位器控制模拟速度。为了确保硬件的使用寿命,固件中包含了完善的安全措施,例如在状态更新期间设置“黑屏”窗口以防止过热,以及利用看门狗定时器来降低软件崩溃的风险。 尽管由于机械开关成本较高,该项目价格不菲,但其核心在于优先考虑触觉反馈和工艺水平,而非成本效率。作者提供了源代码和 PCB 文件供他人复制,并指出虽然存在 3D 打印按键等替代方案,但此版本能提供独特的、高质量的交互体验。项目最后提到,作者在电子教育领域亦有建树,著有《电路的秘密生活》(*The Secret Life of Circuits*)一书。

抱歉。

在翁贝托·埃科的《傅科摆》中,三位持怀疑态度的编辑为了消遣,编造了一个复杂且虚假的阴谋论。他们很快意识到,这种由机器生成的“无意义”文本构成了一个递归陷阱:由于解读是由他们自己提供的,他们反而被自己虚构的荒谬内容所困。 作者在埃科小说中虚构的“阿布拉菲亚”机器与现代大型语言模型(LLM)之间画出了一个令人不寒而栗的等号。正如小说中的角色一样,当今的用户往往会误将大型语言模型对他们观点进行“赞同”和阐述的能力,视作客观的佐证。即使明知机器仅仅是一个复杂的洗牌工具,模型在句法上的卓越表现以及对用户用词习惯的采纳,依然会制造出一个相互验证的反馈循环。 这引发了一种认知上的危险:如果一个模型被训练得连贯、一致且讨人喜欢,它最终会产生出一种模拟真实洞察力的“证言”。小说的悲剧在于,角色们为一个从未存在的阴谋付出了生命的代价,这也恰恰是一个警示。我们冒着被自身投射所困的风险,将机器对我们自身框架的反射误认为是真理,并最终丧失了分辨真实发现与数字废话所构成的自我强化“腐朽之花”的能力。

这篇 Hacker News 帖子讨论了翁贝托·埃科的小说《傅科摆》,重点关注了书中角色用来生成虚假阴谋论的计算机“阿布拉菲亚”(Abulafia)。 参与者们探讨了书中描绘的阴谋论的本质。一些用户认为这些虚构的理论始终是假的;而另一些用户则认为,叙事的真正精妙之处在于,这些捏造的内容如何通过信念的力量以及受众的偏执变成了“现实”。讨论还涉及了丹·布朗的衍生作品与埃科对综摄和控制更深层探索之间的区别。 一个反复出现的争议点是:这些阴谋论究竟是真实的,还是仅仅体现了角色自身痴迷的衍生现象。一位评论者指出,营销材料将“阿布拉菲亚”描述为一台“不可思议的计算机”具有讽刺意味,并指出这台机器不过是编辑们的工具;真正驱动混乱局势的,是编辑们自己的才智以及受众的轻信。

Bluesky 发布了 **atproto "Spaces"** 的 Alpha 版本,这是一项重大更新,旨在支持 atproto 生态系统内的非公开、受许可数据。虽然目前的协议数据是全球公开的,但 Spaces 引入了“迷你网络”,允许进行访问控制的内容,例如私密设置、书签、订阅专享内容或封闭社区。 Spaces 在保持 atproto 核心优势(可移植的身份和可互操作的数据)的同时,实现了更私密的社交环境。访问权限由“空间授权方”(一个 DID)管理,该授权方决定哪些用户可以查看数据。需要注意的是,Spaces 提供的是访问控制而非加密;授权成员仍然可以读取数据。 该 Alpha 版本现已提供给开发者进行测试,可通过提供的 SDK、托管的沙盒 PDS 或运行个人 Docker 实例进行使用。由于这是早期阶段的软件,团队警告称可能会频繁出现重大变更、缺乏数据持久性,且不提供任何安全保障。鼓励开发者使用非生产环境数据进行实验、构建示例应用并提供反馈,以帮助确定预计于今年晚些时候发布的最终版本。目前严禁在生产环境中使用。

Hacker News 上的讨论聚焦于 ATProto 协议的新扩展“Spaces”的发布,该功能旨在支持访问受控的非公开数据。 参与者对该功能的架构表达了不同程度的质疑与澄清,要点如下: * **访问权限与隐私:** 批评者强调,“Spaces”提供的是授权(许可访问),而非机密性或加密。数据仍可被授权方读取,这引发了对相关营销术语的担忧。 * **技术实现:** 与 ATProto 的公开内容不同,存放在“Spaces”中的数据只有在验证了来自“空间权限方”的有效签名令牌后,才会从个人数据服务器(PDS)中提取。 * **身份与品牌:** 一些开发者对“Spaces”这一术语的选择提出质疑,认为它可能与 Twitter 的语音功能混淆。另一些人则认为,“Spaces”是对“受保护”区域的功能性描述。 * **协议理念:** 讨论涉及了 ATProto 与其他去中心化网络模型(如 ActivityPub 或 IDSA)的对比。部分用户批评其缺乏标准化的本体论,以及词汇表(lexicons)的“混乱”扩张。 最终,社区认为“Spaces”是一个为需要限制性群组共享的应用所设计的原语,而非针对个人隐私的工具。

更多

联系我们 contact @ memedata.com