Qualcomm представила Snapdragon 8 Elite Gen 6 и его старшую версию Extreme, рассчитанные на AI-нагрузки без постоянного обращения к облаку. Практическое изменение не в очередном приросте скорости: мобильный агент теперь может локально слушать пользователя, хранить контекст и выполнять часть задач. API перестаёт быть единственным разумным местом для инференса.
Оба чипа выпускаются по 2-нм техпроцессу и предназначены для премиальных Android-смартфонов. CNBC пишет, что устройства на них готовят Motorola, Xiaomi и ZTE. Motorola уже анонсировала Signature 27 с Extreme, его продажи должны начаться в 2026 году.
Агент помещается в телефон
Встроенный Sensing Hub запускает модели размером до 200 млн параметров. По данным TechCrunch, этого достаточно для локальной расшифровки речи, различения говорящих и накопления памяти на основе использования смартфона. Qualcomm также заявляет, что чип способен полностью обслуживать голосового агента, от входящей речи до голосового ответа.
Для более тяжёлых задач Extreme получил увеличенную на 50% общую память NPU и может запускать MoE-модели размером от 30 млрд параметров. MoE, или смесь экспертов, активирует для конкретного запроса лишь часть модели, поэтому число 30 млрд не означает, что телефон одновременно считает все параметры. Новый ускоритель поддерживает контекст до 32 тысяч токенов, пишет Impress Watch.
Это уже не только аргумент про приватность. Если память, персональный контекст и быстрые голосовые команды обрабатываются на устройстве, продукт меньше зависит от сетевой задержки и числа обращений к API. Облаку остаются сложные запросы, обновление данных и задачи, которые не помещаются в мобильный бюджет памяти и энергии. Получается гибридная схема: телефон ведёт постоянную рутину, сервер подключается по необходимости.
Но Qualcomm пока продала возможность, а не доказанный пользовательский опыт. 30-миллиардные модели доступны именно на Extreme, а производители получают два уровня флагманских чипов с разными функциями. TechRadar отдельно замечает, что ещё неизвестно, смогут ли бренды использовать всю заявленную мощность. Независимых тестов производительности и расхода батареи в источниках также нет.
Для компании с мобильным AI-продуктом повод конкретный: разделить текущий пайплайн на локальные и облачные операции, затем пересчитать задержку, расход API и поддержку устройств. Проверять стоит четыре сценария: распознавание речи, краткосрочную память, персонализацию и фоновые действия агента. Ограничение нужно заложить сразу: архитектура не должна требовать Extreme от всей аудитории. Главный маркер после выхода смартфонов: сколько минут агент способен непрерывно работать локально без перегрева и заметного расхода батареи, и какие модели производители действительно разрешат запускать.
