6 октября 2026 года «Сбер» открыл пользователям «ГигаЧата» — российского сервиса генеративного ИИ — бесплатное создание коротких видео с синхронным звуком. Новая модель Kandinsky 6.0 Video генерирует пятисекундные ролики по текстовому описанию или оживляет загруженный первый кадр.
Модель одновременно создаёт видеоряд и аудио. В ролике могут звучать речь с синхронизацией движения губ, музыка и окружающие шумы — например, шаги, ветер или проезжающая машина. Звук генерируется с частотой дискретизации 44 кГц; при необходимости его можно отключить.
В окне ввода «ГигаЧата» доступны варианты SD, HD и Full HD. Разрешение 1920 × 1080 достигается с помощью модуля повышения разрешения: в научной работе он назван встроенным, а в репозитории Pro-версии — отдельным конвейером. Таким образом, Full HD — максимальное разрешение готового результата после обработки, а не обязательно исходное разрешение генерации.
Семейство Kandinsky 6.0 Video включает Lite-модель на 3 млрд параметров и Pro на 29 млрд. Обе поддерживают создание видео со звуком из текста и изображения. Разработчики также опубликовали код, контрольные точки и интеграцию с Diffusers под лицензией MIT, которая разрешает бесплатно встраивать модель в собственные продукты.
По оценке команды Kandinsky, Pro-версия превосходит Kandinsky 5.0 в среднем в 71% сравнений по визуальному качеству, следованию запросу и движению камеры. Независимой внешней проверкой этот результат не является: он основан на тестировании, представленном разработчиками.
Что это значит
- Пользователь «ГигаЧата» может получить короткую сцену с репликой, музыкой и шумами окружения за один запрос, не создавая аудиодорожку отдельно.
- Пяти секунд достаточно для видеооткрытки, мема, заставки или черновой проверки идеи, но более длинный ролик придётся собирать из нескольких генераций.
- Разработчики могут развернуть Kandinsky 6.0 Video или встроить её в свой сервис благодаря опубликованным контрольным точкам, коду и лицензии MIT.

