9 июля 2026 года Google представила LiteRT.js — новый участник семейства LiteRT для запуска моделей машинного обучения непосредственно в веб-браузере. Основной путь ускорения строится вокруг WebGPU, далее предполагается WebNN, а для CPU предусмотрен fallback через WebAssembly.

Для веб-разработки это заметное изменение. Часть AI-сценариев можно выполнять без постоянной отправки данных на сервер: например, локальную классификацию, обработку сигналов, некоторые функции компьютерного зрения или персонализацию интерфейса. Это может уменьшить задержку, снизить серверные расходы и в определённых сценариях лучше защищать пользовательские данные.

Но браузерный AI не отменяет инженерные ограничения. Нужно учитывать размер модели, время загрузки, память устройства, нагрев, энергопотребление и разницу между мобильными и настольными браузерами. Для публичного продукта также необходим понятный fallback: функция не должна ломаться только потому, что конкретное устройство не поддерживает нужное ускорение.

Для команд, которые создают веб-сервисы, появление таких runtime расширяет выбор архитектуры. Теперь вопрос звучит не только «какую модель использовать», но и «где её выполнять» — в облаке, на собственном сервере, на устройстве пользователя или комбинировать эти варианты.