本仓库提供了一个硬件原生控制平面的概念验证(PoC),旨在最大限度地减少超大规模人工智能架构中的光子路由延迟。通过绕过电光转换缓冲和传统的基于软件的重对齐,该项目致力于为分布式大语言模型工作负载(如 DeepSeek-V4)实现亚纳秒级的定时精度。 该架构利用三层系统将光子定时与高级执行噪声隔离: * **第一层(裸机):** 使用 GPU 寄存器混洗(`__shfl_sync`)和无分支位运算多路复用器(MUX),在不触发流水线停顿或线程束分歧的情况下减轻光学抖动。 * **第 1.5 层(桥接):** 实现零拷贝 DLPack 内存隧道和异步 RAII 硬件防护,以保护执行图免受宿主机端垃圾回收和解释器延迟的影响。 * **第二层(治理):** 采用 `jax.shard_map` 来强制执行全局拓扑稳定性,并维持多机箱集群间的数值稳态。 作为一种探索性研究框架,该引擎提供了一个自动化挂钩,可将此光子路由逻辑直接注入现有的模型编译图中。该项目处于早期原型阶段,欢迎社区共同协作以完善其硬件协同设计假设与可扩展性。
2022 年,作者创建了一个名为“PaintBrush”的 Python 类,旨在通过创意视觉项目引导高中生学习编程。尽管如今人工智能可以在几秒钟内生成此类代码,但作者认为这些课程依然至关重要。教育者不应将人工智能视为威胁,而应利用它快速构建各种全新的抽象工具(如音乐合成器或数据可视化工具),从而让学生保持创造力挑战。
其目标是将重心从容易诱发人工智能“走捷径”的枯燥重复性任务,转向能够让学生获得成就感与自我效能感的有意义项目。通过将高阶抽象作为创意表达的工具,教师可以激发学生的内在参与度,鼓励他们亲手编写代码——这并非因为他们缺乏人工智能助手,而是因为创作过程本身真实、具有表现力且充满乐趣。归根结底,利用大语言模型快速生成新工具,使教育者能够不断更新课程,从而确保每一位学生的学习体验都既有收获又独具个人色彩。
Numba JIT 编译器现已可通过 JupyterLite 在浏览器中完全运行,从而无需远程服务器即可进行高性能科学计算。此前,由于浏览器限制应用程序创建可执行内存——这是 Numba 原生 JIT 编译的必要条件,因此无法实现此功能。
为了克服这一难题,开发人员为 `llvmlite` 创建了一个支持 WebAssembly 的全新执行引擎。该架构不再使用标准的 JIT 机制,而是将 LLVM IR 编译为 WebAssembly 目标文件,通过进程内的 `lld` 链接器进行链接,并将其作为 Emscripten 副模块动态加载。这种方法使 Numba 能够以原生方式在浏览器中运行,与标准 Python 相比,性能显著提升,某些情况下可达 250 倍。
通过 `emscripten-forge` 对 Numba 进行打包,该解决方案现已支持包括 PyTensor、PyMC 以及各种数值经济学工具在内的庞大科学计算库生态系统。这一进展将 JupyterLite 从简单的 Python 环境转变为能够进行严肃编译型科学计算的平台,使复杂的编译器栈能够在浏览器的安全模型下高效运行。