Google перевёл Gemini 3.8 Live with Live Avatar в общую доступность для корпоративных клиентов. Главное здесь не говорящая голова, а готовая связка: агент принимает видео и звук, отвечает голосом, переключается между языками и параллельно выполняет действия во внутренних системах компании.
В блоге Google Cloud продукт называют готовым к промышленному использованию через Gemini Enterprise и Gemini Live API. Доступны endpoints в США и ЕС, provisioned throughput, корпоративные настройки соответствия требованиям и управления данными.
Gemini 3.8 Live использует нативный speech-to-speech, то есть работает со звучащей речью без традиционной цепочки из распознавания текста и последующего синтеза ответа. По заявлению Google, это помогает агенту естественнее обрабатывать перебивания, не теряя контекст разговора и запущенных операций.
Live Avatar добавляет синхронизированное видео для веба, мобильных приложений и интерактивных киосков. Агент умеет анализировать изображение с камеры или демонстрацию экрана одновременно со звуком, а также автоматически определять и менять один из 97 поддерживаемых языков прямо во время разговора.
Самая практичная функция спрятана за менее эффектным названием asynchronous tool calling. Агент может в фоне обращаться к API, CRM или ERP и продолжать говорить, пока система выполняет запрос. Иными словами, проверка заказа, заполнение карточки или поиск данных больше не обязаны сопровождаться цифровым аналогом неловкого молчания.
Google показывает сценарий страхового обращения: пользователь демонстрирует повреждение на камеру, агент заполняет данные, а команда агентов в фоне проверяет полис, применяет правила и собирает пакет для специалиста. Cox Automotive уже использует live-подсветку экрана и вызовы инструментов в помощнике Autotrader для поиска, сравнения и финансирования автомобилей.
Для бизнеса это прежде всего тест на лишнюю сложность текущего стека. Если продукт собран из отдельных модулей распознавания речи, видеоанализа, аватара и оркестрации действий, Gemini теперь предлагает проверить, можно ли убрать часть интеграционных швов. Выигрыш здесь не обязательно в качестве каждого отдельного компонента, а в том, что разговор, зрение и транзакции живут в одной сессии.
Цена упрощения очевидна: больше логики переезжает в контур одного поставщика. Есть и два прямых ограничения. Собственные аватары доступны только компаниям из allowlist после проверки, остальные могут использовать библиотеку готовых образов. Gemini 3.8 Live Extended Thinking, версия с расширенным рассуждением, всё ещё находится в private preview. Поэтому начинать пилот уже можно, но считать весь заявленный набор функций общедоступным пока рано.

