NVIDIA заявила о снижении стоимости токенов на Blackwell за счет inference-стека
NVIDIA заявила, что по мере перехода компаний от пилотных ИИ-проектов к промышленной эксплуатации главным показателем инфраструктуры становится стоимость токена: сколько полезных токенов можно получить на доллар, ватт и при заданной задержке. Как пишет NVIDIA Blog, программный inference-стек компании, разработанный вместе с GPU, CPU, сетевыми решениями и системами NVIDIA, за месяц снизил стоимость токенов для модели DeepSeek V4 на платформе Blackwell до 5 раз.
В NVIDIA объясняют результат сочетанием нескольких уровней оптимизации. Речь идет об управлении распределенным inference, autoscaling и памятью, runtime-оптимизациях, а также доступе к возможностям GPU и сетевой инфраструктуры. В компании также утверждают, что комбинация disaggregated serving, large expert parallelism через NVIDIA NVLink, NVFP4 precision и multi-token prediction способна увеличить throughput до 20 раз.
Этот стек уже используют несколько компаний в рабочих сценариях. Baseten применила библиотеку NVIDIA TensorRT-LLM для обслуживания DeepSeek V4 Pro на Blackwell GPU и сообщила о росте производительности до 50% по числу токенов в секунду. Cognition использует NVIDIA Dynamo для управления inference-GPU в задачах reinforcement learning. Deep Infra и Together AI, в свою очередь, задействуют стек NVIDIA для запуска open source-моделей и production-сервисов на Blackwell, включая DeepSeek V4 и инфраструктуру для Cursor.
Ключевые факты
NVIDIA заявила о снижении стоимости токенов для DeepSeek V4 на платформе Blackwell до 5 раз за один месяц
Baseten сообщила о росте производительности до 50% по числу токенов в секунду при использовании NVIDIA TensorRT-LLM
NVIDIA утверждает, что сочетание disaggregated serving, NVLink, NVFP4 precision и multi-token prediction может увеличить throughput до 20 раз
Cognition использует NVIDIA Dynamo для управления inference-GPU в задачах reinforcement learning