← В ленту Статья · 1 сентября · 2 мин
Статьи

PhoneLLM Alpha 1: умные колонки избавятся от задержек

Разработчики представили модель PhoneLLM Alpha 1, которая ускоряет голосовые ответы на 1,3 секунды и обходится на 94% дешевле аналогов. Это позволит умным колонкам и технике общаться без неестественных пауз и обязательных платных подписок.

Фото: Reddit (trendwatch)

Разговор с современным голосовым ассистентом до сих пор напоминает звонок по спутниковому телефону из глухого тоннеля. Вы задаете простой вопрос, смотрите на пульсирующее кольцо умной колонки и две секунды ждете в полной тишине, пока огромный облачный кластер думает над ответом. Дело вовсе не в домашнем Wi-Fi, а в избыточной вычислительной нагрузке универсальных нейросетей. Команды Daily и Pipecat при создании PhoneLLM Alpha 1 наглядно показали: передовые модели тратят драгоценные секунды на внутренние рассуждения, прежде чем произнести вслух хотя бы один слог. Если же этот скрытый этап убрать ради скорости, стандартные алгоритмы начинают часто ошибаться и придумывать несуществующие результаты — например, утверждать, что забронировали столик в ресторане, даже не отправив команду в сервис бронирования.

Сокращение задержек и расходов

PhoneLLM Alpha 1 решает проблему неестественных пауз, отказываясь от тяжеловесных универсальных нейросетей в пользу компактной и специализированной архитектуры. Модель построена на базе Nemotron 3 Nano 30B-A3B от NVIDIA и использует гибридный модульный подход (Mixture of Experts). Хотя всего в ней заложено 30 миллиардов параметров, для обработки каждого запроса одновременно задействуется лишь 3,5 миллиарда при внушительном объеме контекста в 262 144 токена.

«PhoneLLM работает на уровне флагманской GPT-5.6 Terra, но обходится на 94% дешевле и начинает отвечать на 1300 мс быстрее при пиковых нагрузках».

По замерам Pipecat, ускорение генерации первого слога на 1300 миллисекунд снижает общую задержку диалога примерно втрое. Это убирает раздражающие паузы, из-за которых общение с гаджетами кажется натянутым. Что важнее для производителей электроники, удешевление серверных вычислений примерно в 18 раз позволит внедрять живые голосовые интерфейсы в домашние колонки и умную технику без необходимости навязывать пользователям дорогие ежемесячные подписки.

Открытые технологии против закрытых сервисов

В бенчмарке PhoneBench v1 модель PhoneLLM Alpha 1 показала результаты на уровне закрытых решений вроде GPT-5.6 Terra в сценариях техподдержки, заказов и бронирования, избавив разработчиков от привязки к чужим облакам. Архитектура распространяется под свободной лицензией BSD 2-Clause и включает готовую конфигурацию под аппаратные ускорители NVIDIA Blackwell B200, легко разворачиваясь на стандартных серверных платформах вроде vLLM или SGLang.

Правда, перенесут ли бренды эту экономию на стоимость потребительских гаджетов или предпочтут просто увеличить собственную маржу — пока остается открытым вопросом.

Источник Reddit (trendwatch) → © 2026 «Гад же ты». Полное или частичное копирование — со ссылкой на эту страницу.