AI
Cloudflare 大规模部署 Kimi 和 GLM 的三项优化
Smaller, faster, safer: running Kimi and GLM at scale
Cloudflare Workers AI 上跑着 Moonshot 的 Kimi K 系列和智谱的 GLM。这些都是长上下文的 MoE 大模型,瓶颈在 GPU 显存。文章标题里的三个词对应三项优化:
- 更小:KV cache 从 BF16 量化到 FP8。 KV cache 体积减半,Kimi K2.6 在显存里能放下的上下文总量从约 68.6 万 token 提到约 137 万;64 并发时吞吐 2,192 token/s,比 BF16 的峰值高约 41%。
- 更快:权重从 8 位压到 INT4。 GLM 5.2 的 checkpoint 从 705GB 降到 421GB,单并发 decode 速度提升 55%。
- 更安全:共享缓存加完整性校验。 多个请求复用同一份缓存时,校验数据没有被写错,吞吐和尾延迟的开销都控制在 1% 以内。
精度方面,所有优化在基准测试上与 FP8 模型的差距都在 0.8 分以内。
平时调 API 看不到这些,但 token 价格和上下文长度很大程度由这一层决定。想了解推理侧在做什么,这篇的数据比较完整。
交互式学习徐亦达教授的机器学习讲义
徐亦达(Richard Xu)现在在香港浸会大学任教,他的机器学习讲义在 GitHub 上有 1 万多 star,累计 2000 多页 PDF,从模型评估、贝叶斯、回归,到 EM、MCMC、变分推断、状态空间模型,再到 CNN、生成模型、强化学习、贝叶斯非参数,覆盖得很全。2015 年他还录过约两成内容的中文视频,B 站能找到。
讲义偏数学推导,单看 PDF 门槛不低。交互网站由原始 LaTeX 讲义改编,中文界面,分成入门、统计机器学习、优化、概率推断、贝叶斯非参数、深度学习、微分方程方法、机器学习理论、强化学习、应用十个部分,共 63 个主题,大部分已上线。每个主题分若干章,配 1–8 个交互实验,比如 Transformer 有 10 章、8 个实验。部分主题需要注册才能看,首页的线性代数小游戏不用注册,可以先试试。
想补数学基础、或者想弄清楚 Transformer、扩散模型背后推导的前端同学,可以从这里入手,再对照 PDF 看细节。
前端
Bun 1.4:现有 Node.js 项目更容易直接跑起来
7 月刊介绍了 Bun 从 Zig 迁到 Rust 的过程,1.4 是迁移后的第一个大版本,重点是 Node.js 兼容。
- 新增通过 1,517 项 Node.js 官方测试,是 1.0 以来兼容性提升最大的一次。
- Playwright、Vitest(含覆盖率)、Next.js 16(
bun --bun next build)、Nuxt 的 HMR 和 DevTools、OpenTelemetry 都能正常工作。 - 空闲 CPU 降到原来的 1/5;启动时间 Linux 从 10.9ms 到 5.1ms,Windows 从 39.0ms 到 15.5ms;服务端内存少 13%–48%,Fastify 从 233MB 降到 120MB。
官方也写明了 Bun 还没有做到 100% 兼容 Node.js,部分模块仍有差距。文中汇总的图片处理、Markdown、定时任务等内置能力,有一些是 1.3 系列就加入的,不全是 1.4 新功能。