Коммерсантъ FM

Архитектура компромисса: почему носимый ИИ по силам единицам

Рынок перспективен, но закрепятся на нем только технологически диверсифицированные компании

Современные большие языковые модели требуют для работы сотен гигабайт памяти и специализированной внушительной аппаратной части. Но современные носимые устройства с ИИ-функциями — наушники, очки и кулоны — весят 5–6 граммов и работают от батареи несколько часов. Между этими двумя реальностями — целый пласт инженерных задач и решений, которые в Google сейчас называют главным вызовом отрасли.

Фото: AI Generated / Коммерсантъ

Фото: AI Generated / Коммерсантъ

Носимый ИИ — новая категория потребительских устройств с нейросетями, встроенными непосредственно в гаджет, который ранее не подразумевал наличие таких функций. На рынке уже представлены смарт-очки (Ray-Ban от Meta, признанной экстремистской и запрещенной в РФ), наушники (Google Pixel Buds с ассистентом Gemini, «Яндекс Дропс» с Алисой AI), клипсы-диктофоны (Bee), смарт-кольца (Oura), кулоны и др.

Рынок носимого ИИ при этом растет быстрее большинства сегментов потребительской электроники. По прогнозу Fortune Business Insights, его объем вырастет с $62,7 млрд в 2024 году до $359,3 млрд к 2034-му — за счет развития мониторинга здоровья, edge AI и мультимодальных ассистентов.

В индустрии нет единого мнения, какой из форматов для пользователей станет основным. Глава Qualcomm Кристиано Амон заявил, что компания разрабатывает более 40 носимых ИИ-устройств — от украшений до наушников с камерами: в Qualcomm считают, что следующей вычислительной платформой станет не телефон. IDC ожидает, что в ближайшей перспективе рост рынка обеспечат очки без дисплея: за год продажи смарт-очков Ray-Ban от запрещенной Meta выросли более чем втрое, а число проданных устройств превысило 7 млн.

Основным пользовательским интерфейсом для ИИ в ближайшие годы могут стать наушники, а не умные очки, считает Виниджа Джайн, ведущий инженер Google по направлению генеративного ИИ и ИИ-агентов. «Формат наушников не требует от пользователей изменения привычек: наушники уже широко используются в повседневной жизни», — рассказывает госпожа Джайн. Ключевыми игроками рынка носимых ИИ-устройств эксперт называет, помимо Google, «Яндекс», Apple и OpenAI — все они развивают наушники как ИИ-интерфейс.

«Пока нельзя сказать, какой именно формат станет массовым: эксперименты с “умными очками”, например, пока так и не увенчались успехом. Если носимый ИИ станет привычным способом доступа к сервисам, выигрывать будут компании, которые контролируют не только устройство, но и ассистента, данные, контент и экосистему, — комментирует Александр Абрамян, инвестиционный аналитик, автор блога «Инвестиции с Александром Абрамяном», — На этом фоне недавний запуск “Яндекс Дропс” важен не только как релиз новых наушников, а как сигнал: российский рынок переходит из числа догоняющих в глобальной гонке ИИ в число пионеров индустрии — по крайней мере, в сфере носимых ИИ-устройств. У “Яндекса” для этого есть три ключевых преимущества — собственный ИИ-ассистент, опыт в умных устройствах и большая экосистема сервисов. В этом смысле компания ближе к логике Google с Pixel Buds, чем к OpenAI или Anthropic: ИИ здесь не отдельный продукт, а дополняющий интерфейс к поиску, музыке, навигации, календарю, умному дому и другим сервисам».

Конкуренция в сегменте носимого ИИ действительно постепенно смещается от отдельных устройств к технологическим экосистемам, пишет издание Entrepreneur. Сегодня наиболее сильные позиции получают компании, которые уже развивали голосовых ассистентов и потребительские ИИ-устройства: работа над умными колонками позволила Google, Amazon, «Яндексу» и другим игрокам заранее решить многие задачи, с которыми теперь сталкивается носимый ИИ, — от распределения вычислений между устройством и облаком до создания сценариев, в которых ИИ становится частью повседневной жизни пользователя.

С этим соглашается и Виниджа Джайн. «Победителями станут компании, располагающие полным технологическим стеком — ИИ-моделями, инфраструктурой и устройствами», — комментирует она. Одним из главных вызовов для отрасли госпожа Джайн считает ограничения носимых устройств по объему памяти и вычислительным ресурсам.

Не всем разработчикам удается адаптировать генеративный ИИ под ограничения носимых устройств. Стартап Humane, основанный бывшими сотрудниками Apple и привлекший $230 млн инвестиций, закрыл проект носимого ИИ-гаджета с голосовыми функциями AI Pin спустя менее года после запуска: устройство критиковали за перегрев, низкую автономность и нестабильную работу. По данным The Verge, в отдельные периоды число возвратов устройств превышало объем продаж. В феврале 2025 года компания прекратила выпуск AI Pin.

Сложность локального запуска нейросетей идет с двух сторон: «железо» и софт. Нужно решить, какие функции девайс выполняет сам, а что отправляет в облако, и какого чипа хватит на локальную часть, рассуждает руководитель группы специальных проектов ML-департамента Positive Technologies Алексей Пехтерев. Можно собрать девайс кратно дороже и мощнее iPhone, но полностью отвязаться от облака не выйдет, подчеркивает эксперт: языковые модели вроде ChatGPT останутся в дата-центрах на тысячах серверов с GPU, и все «тяжелое», сложное все равно будет отправляться туда. Необходим баланс: на устройстве остается, например, только распознавание обращения к ассистенту. «Вероятно, что как раз с этим балансом у Humane не сложилось. Локально на Pin не считалось почти ничего, а в цепочке отправки данных с девайса много мест, где что-то может пойти не так, отсюда накопленные десятисекундные паузы, зависимость от связи и обязательная подписка сверху. При этом устройство все равно грелось и нагружало батарею: мобильный процессор, но с постоянно работающими модемом и камерой, лазерный проектор в корпусе размером со значок, где теплу некуда деваться», — предположил Алексей Пехтерев.

Установить работающую нейросеть в носимое устройство — задача не про «сжатие», а про инженерию под жесткие ограничения по памяти и энергопотреблению, говорит ведущий инженер-программист НОЦ ФНС России и МГТУ им. Н. Э. Баумана Николай Калуцкий. Следующий барьер — тепловыделение и риск перегрева. Например, серверный ускоритель A100 выделяет до 400 Вт тепла, и чтобы избежать ожогов, мощность устройства приходится искусственно ограничивать — до 70% от номинала, поэтому перенести всю модель на носимое устройство невозможно. В такой архитектуре на устройстве целесообразно оставлять только функции управления нейросетью, без выполнения тяжелых вычислений — они делегируются на сервер. При этом чем меньше корпус, тем меньше места для аккумулятора и тем острее конкуренция между вычислительной мощностью и временем автономной работы. Добавляется и конкуренция за энергопотребление: помимо ИИ-модуля, устройство оснащается Wi-Fi, Bluetooth и другими модулями, каждый из которых потребляет энергию, отмечает господин Калуцкий.

Ранее о схожей проблеме заявляли в «Яндексе». Как отмечал представитель компании Дмитрий Солодуха в комментарии для издания «Хайтек», компактные гаджеты сильнее ограничены по емкости аккумулятора, объему памяти и вычислительной мощности процессора. При этом система голосовой активации для взаимодействия с пользователем должна постоянно анализировать аудиопоток и обрабатывать его локально в ожидании ключевой команды, не создавая заметной нагрузки на устройство и не сокращая время его автономной работы. Для «Яндекс Дропс» компания разработала сверхкомпактную нейросетевую модель для голосового управления: размер модели удалось сократить примерно до 200 КБ без заметной потери качества — это меньше объема одной фотографии на смартфоне.

Помимо инженерных задач, разработчикам носимого ИИ приходится отвечать и на вопросы о безопасности данных. С точки зрения архитектуры безопасности, описанный подход — локальное распознавание слова активации без записи аудиопотока и последующая обработка в облаке — на сегодняшний день является индустриальным стандартом для потребительских устройств, говорит председатель координационного совета НСБ РФ Игорь Бедеров.

«Главная заслуга такой модели в том, что микрофон не превращается в круглосуточный записывающий жучок. Это действительно снижает риск локальной утечки. Как только устройство услышало триггерную фразу, кусочек последующей речи конвертируется в сжатый аудиофрагмент и отправляется в облачную инфраструктуру. И вот здесь начинается зона настоящих рисков. Но где вы наблюдали идеально сконфигурированную облачную среду без человеческой ошибки или устаревшего сертификата?», — рассуждает он.

Комментируя вопрос безопасности, инженер по безопасности «Алисы» и умных устройств «Яндекса» Никита Лычаный отметил, что устройство не ведет постоянную запись окружающих разговоров. Встроенный споттер реагирует только на активационное слово, после чего слышит команду пользователя. Затем она в зашифрованном виде передается на сопряженное мобильное устройство, которое также по защищенному каналу отправляет запрос на серверы компании для дальнейшей обработки.

По словам эксперта, безопасность устройства оценивалась комплексно: специалисты анализировали прошивку, проверяли защищенность Bluetooth-взаимодействия, а также инфраструктуру и мобильное приложение по релевантным практикам OWASP. Такой подход применяется ко всем устройствам и сервисам компании, а для поддержания актуального уровня безопасности регулярно выпускаются обновления прошивки и приложения.

Новости компаний Все