该文档是一个 GitHub 仓库页面,项目名称为“liang-wenfeng-investor-meeting-2026-7-22”,所有者为用户“demo-zexuan”。 该仓库包含一个主要文件:一个大小为 1.58 MB 的 PDF 文档,名为“梁文锋投资者交流会-文字稿_1_18_translate_20260723201651.pdf”。该页面作为文件托管界面,展示了 GitHub 的标准功能,如仓库元数据、派生(fork)和星标(star)计数,以及用于管理议题(issues)、合并请求(pull requests)和项目洞察(insights)的导航工具。该仓库似乎是一个特定投资者关系活动的文档归档。
一位开发者成功在售价 8 美元的 ESP32-S3 微控制器上运行了一个拥有 2890 万参数的语言模型,生成速度约为每秒 9.5 个 token。相比此前受限于严格内存限制而只能运行约 26 万参数的模型,这标志着微控制器端模型处理能力的大幅提升。
这一突破得益于谷歌 Gemma 模型中所采用的“逐层嵌入”(Per-Layer Embeddings)技术。通过将大部分参数(2500 万个)存储在芯片的慢速闪存中,仅在需要时加载必要数据,该系统绕过了对大量快速 SRAM 的需求。模型中仅有“思考”核心部分保留在芯片有限的快速内存中,其余部分则留在闪存内。
虽然该模型是在 *TinyStories* 数据集上训练的,仅限于生成简单、连贯的叙事内容,而非进行复杂的推理或基于事实的任务,但该项目展示了一项重大的架构成就。它证明了大规模参数可以在低成本、极简硬件上高效运行,扩展了边缘 AI 的可能性。该项目的固件、训练代码和实验结果均已公开供查阅。