К содержанию
Новости

NVIDIA заявила о снижении стоимости токенов на Blackwell за счет inference-стека

NVIDIA заявила о снижении стоимости токенов на Blackwell за счет inference-стека

NVIDIA заявила, что по мере перехода компаний от пилотных ИИ-проектов к промышленной эксплуатации главным показателем инфраструктуры становится стоимость токена: сколько полезных токенов можно получить на доллар, ватт и при заданной задержке. Как пишет NVIDIA Blog, программный inference-стек компании, разработанный вместе с GPU, CPU, сетевыми решениями и системами NVIDIA, за месяц снизил стоимость токенов для модели DeepSeek V4 на платформе Blackwell до 5 раз.

В NVIDIA объясняют результат сочетанием нескольких уровней оптимизации. Речь идет об управлении распределенным inference, autoscaling и памятью, runtime-оптимизациях, а также доступе к возможностям GPU и сетевой инфраструктуры. В компании также утверждают, что комбинация disaggregated serving, large expert parallelism через NVIDIA NVLink, NVFP4 precision и multi-token prediction способна увеличить throughput до 20 раз.

Этот стек уже используют несколько компаний в рабочих сценариях. Baseten применила библиотеку NVIDIA TensorRT-LLM для обслуживания DeepSeek V4 Pro на Blackwell GPU и сообщила о росте производительности до 50% по числу токенов в секунду. Cognition использует NVIDIA Dynamo для управления inference-GPU в задачах reinforcement learning. Deep Infra и Together AI, в свою очередь, задействуют стек NVIDIA для запуска open source-моделей и production-сервисов на Blackwell, включая DeepSeek V4 и инфраструктуру для Cursor.

Ключевые факты

  • NVIDIA заявила о снижении стоимости токенов для DeepSeek V4 на платформе Blackwell до 5 раз за один месяц

  • Baseten сообщила о росте производительности до 50% по числу токенов в секунду при использовании NVIDIA TensorRT-LLM

  • NVIDIA утверждает, что сочетание disaggregated serving, NVLink, NVFP4 precision и multi-token prediction может увеличить throughput до 20 раз

  • Cognition использует NVIDIA Dynamo для управления inference-GPU в задачах reinforcement learning