К содержанию

Thinking Machines Lab представила языковую модель Inkling с открытыми весами

В Telegram

Thinking Machines Lab представила свою первую большую языковую модель Inkling. Стартап основала Мира Мурати, ранее занимавшая пост технического директора OpenAI. Как сообщает Heise online, Inkling построена на архитектуре MoE и насчитывает 975 млрд параметров, из которых активны 41 млрд. Сейчас это крупнейшая модель с открытыми весами, созданная за пределами Китая.

Веса доступны в форматах bfloat16 и NVFP4. Даже в более компактном NVFP4 модели требуется около 600 Гбайт оперативной памяти только для параметров, а в bfloat16 объем достигает 2 Тбайт. Inkling состоит из 66 слоев и включает 256 экспертов. При каждом предсказании задействуются шесть из них, а также два общих эксперта. Длина контекста составляет 1 млн токенов. Модель работает с текстом, изображениями и аудио.

Кроме того, в Inkling встроена меньшая модель, которая предсказывает несколько токенов. Если прогноз оказывается верным, основная модель может за один шаг проверить эти токены и сгенерировать еще один. Это повышает скорость вывода и сокращает среднее число параметров, задействованных при предсказании. Дообучать Inkling на собственных данных можно через платформу Tinker.

Ключевые факты

  • Из 975 млрд параметров Inkling при вычислениях активны 41 млрд.

  • Даже в формате NVFP4 модель требует около 600 Гбайт оперативной памяти, а в bfloat16, 2 Тбайт.

  • Модель состоит из 66 слоев и включает 256 экспертов, из которых при каждом предсказании активны шесть и еще два общих эксперта.

  • Длина контекста Inkling составляет 1 млн токенов.

Вопросы и ответы

Какая инфраструктура нужна для запуска Inkling?

Только для хранения параметров потребуется около 600 Гбайт оперативной памяти в формате NVFP4 или 2 Тбайт в bfloat16.

С какими данными и объемом контекста работает модель?

Inkling обрабатывает текст, изображения и аудио, а длина контекста достигает 1 млн токенов.

Как устроены инференс и дообучение на корпоративных данных?

При каждом предсказании активируются шесть из 256 экспертов и два общих эксперта, а встроенная меньшая модель ускоряет генерацию за счет предсказания нескольких токенов. Дообучение на собственных данных доступно через платформу Tinker.

Контекст по теме

Как процитировать этот материал

«Thinking Machines Lab представила языковую модель Inkling с открытыми весами». hegai.media, 18 августа 2026 г.. https://hegai.media/novosti/thinking-machines-lab-predstavila-yazykovuyu-model-inkling-s-otkrytymi--dfd84908-8121-4eba-a204-ff4ca7224f02