2026 年 7 月 9 日,Google 发布 LiteRT.js,这是 LiteRT 家族面向 Web 的新运行时,可直接在浏览器中执行机器学习模型。主要加速方式是 WebGPU,未来将支持 WebNN,同时通过 WebAssembly 提供 CPU 备用路径。

这对 Web 工程是一个重要变化。部分 AI 任务不再需要持续把数据发送到远程服务器,例如本地分类、信号处理、部分计算机视觉和个性化界面。合适的场景下,这既能降低延迟和后端成本,也能让更多用户数据留在设备本地。

当然,浏览器 AI 仍然受到实际限制。模型大小、下载时间、设备内存、发热、耗电以及桌面与移动浏览器之间的性能差异都需要考虑。生产系统还必须提供降级方案,不能假设所有设备都支持同样的硬件加速能力。

对产品团队来说,LiteRT.js 扩大了架构选择。问题不再只是“使用哪个模型”,而是“在哪里运行模型”:云端、自有基础设施、用户设备,或者将这些方式组合起来。