К содержанию
Новости

Vidraft представила систему VKAE для ускорения инференса ИИ на Nvidia B200

Vidraft представила систему VKAE для ускорения инференса ИИ на Nvidia B200

Компания Vidraft опубликовала результаты тестирования системы ускорения инференса VKAE. По заявлению разработчиков, в отдельных сценариях она позволяет увеличить производительность существующих GPU до 23 раз без изменения аппаратной части. Тесты проводились на ускорителе Nvidia B200. В компании уточняют, что итоговое ускорение зависит от архитектуры конкретной модели и может заметно отличаться.

Как сообщает iXBT, одним из показательных примеров стала модель Qwen3.5-35B-A3B. При высокой конкурентной нагрузке система показала суммарную производительность свыше 10 тысяч токенов в секунду. Для более разнообразных реальных запросов производительность той же модели составила около 455 токенов в секунду. Разработчики также утверждают, что во время тестов не наблюдалось ухудшения качества или точности выходных данных.

Отдельно в Vidraft подчеркнули воспроизводимость результатов. Вместе с показателями производительности компания предоставляет единый контейнер с весами модели и оптимизированной средой выполнения. Решение совместимо с интерфейсами OpenAI API, поэтому, по словам авторов проекта, систему можно интегрировать в существующую инфраструктуру практически без изменений. При этом сам механизм ускорения в VKAE пока не раскрывается. Разработчики сообщили, что описание технологии готовится к публикации в формате препринта.

Ключевые факты

  • Тестирование VKAE проводилось на графическом ускорителе Nvidia B200.

  • Для модели Qwen3.5-35B-A3B заявлена производительность свыше 10 тысяч токенов в секунду при высокой конкурентной нагрузке.

  • Для более разнообразных реальных запросов производительность Qwen3.5-35B-A3B составила около 455 токенов в секунду.

  • VKAE совместима с интерфейсами OpenAI API и поставляется в виде контейнера с весами модели и оптимизированной средой выполнения.