OpenAI связала с Moonshot AI организованную кампанию по извлечению скрытых рассуждений своих моделей: в пиковый момент система получила 16 000 запросов от более чем 4 000 пользователей за два дня. Это не было проникновением в серверы OpenAI. Спор идёт о другом: можно ли превратить легально доступные ответы чужой нейросети в учебник для своего прямого конкурента.
Как OpenAI связала сбор ответов с Moonshot AI
По данным CNBC, активность началась в начале июля 2026 года. OpenAI обнаружила связанные запросы более чем от 15 000 пользователей и заявила, что полностью остановила кампанию к 28 июля. Компания не утверждает, что все аккаунты управлялись одним участником, но связывает основную группу с людьми, имеющими отношение к Moonshot AI, разработчику семейства моделей Kimi. Moonshot на запрос CNBC не ответила.
Операторы не получили доступ к базам данных, шифрованию или сохранённым разговорам пользователей. Они манипулировали запросами так, чтобы скрытые рассуждения модели становились видимыми в ответе. OpenAI называет это adversarial distillation, то есть дистилляцией, при которой ответы или ход решения одной модели собирают для улучшения другой.
Обвинение появилось не на пустом месте. Американские чиновники уже заявляли, что Kimi K3 могла использовать результаты работы моделей Anthropic. Как писал TechCrunch, специалисты встретили эту версию скептически: между публичным запуском Anthropic Fable 1 июля и выходом Kimi K3 15 июля прошло слишком мало времени, чтобы только на её ответах собрать данные, обучить сильную модель и подготовить релиз.
Wired рассказал об исследовании, где Kimi K3 на отдельных запросах выдавала рассуждения, похожие на скрытые цепочки Claude Opus 4.8 и GPT 5.6 Sol. Авторы прямо предупредили: такое сходство не позволяет причинно установить дистилляцию. У DeepSeek и модели Inkling аналогичного совпадения с Claude Opus исследователи не обнаружили.
Сам метод при этом не является экзотикой китайских лабораторий. Илон Маск сообщил в суде, что xAI частично использовала дистилляцию моделей OpenAI при обучении Grok, пишет TechCrunch. Он назвал это общей практикой отрасли.
Как ответы учителя превращаются в новую модель
В классической дистилляции есть большая модель-учитель и более компактная модель-ученик. Учителю дают набор запросов, сохраняют ответы, а затем дообучают ученика воспроизводить полезное поведение. В результате маленькая модель может приблизиться к большой на конкретной задаче, хотя обычно хуже справляется с вопросами, которых не было в учебном наборе.
Если разработчик владеет обеими моделями, он может передавать ученику распределения вероятностей для следующих слов. Это так называемые мягкие метки: они показывают не только выбранный ответ, но и альтернативы, которые учитель считал правдоподобными. Через закрытый сервис такой внутренней информации обычно нет, поэтому остаётся black-box-подход: собирать видимый текст ответов и проводить supervised fine-tuning, то есть дообучение на парах «запрос-ответ».
Hugging Face выделяет несколько современных вариантов. При обычной дистилляции маленькая модель повторяет большую. При on-policy-дистилляции ученик сам генерирует решения, а специализированные учителя оценивают каждый шаг. При самодистилляции модель создаёт и фильтрует собственные учебные данные. В работе Self-Verified Distillation модель проверяла свои решения по трём критериям и училась только на ответах, прошедших все проверки.
Отсюда важное различие. Дистилляция собственной модели, работа с разрешённым учителем и автоматизированный сбор ответов конкурента технически могут выглядеть похоже. Конфликт возникает из-за происхождения данных, масштаба запросов, условий сервиса и цели, ради которой создаётся копия.
Причём ученик перенимает не только полезные навыки. Исследование о скрытой передаче поведенческих черт показало, что модель может усвоить предпочтения учителя даже из данных, которые внешне не относятся к этим предпочтениям. В экспериментах использовалось по 30 000 ответов, а фильтры удаляли от 23% до 38% примеров. Это означает, что синтетический датасет надо проверять не только на качество текста, но и на нежелательное поведение.
Сколько запросов и экономии даёт дистилляция
| Пример | Учитель и ученик | Результат |
|---|---|---|
| Кампания, описанная OpenAI | Модели OpenAI и предполагаемые сборщики ответов | 16 000 запросов от более чем 4 000 пользователей за два дня; всего связанная активность более 15 000 пользователей |
| Amazon Bedrock | Большая и компактная модели из каталога сервиса | До 500% выше скорость, до 75% ниже стоимость, менее 2% потери точности на задачах вроде поиска по базе знаний с генерацией ответа |
| Инженерная модель для энергетики | DeepSeek-V3.2-Reasoner на 671 млрд параметров и Qwen на 1,5 млрд | Около 400-кратного сжатия; ответ был ближе к эталону в 90,5% проверочных сравнений |
| Самодистилляция Qwen3-4B | Модель генерирует и проверяет собственные решения | Рост результата на 16,7 пункта в математике, 11,1 в науке и 8,3 в программировании |
Цифры показывают, почему спор настолько нервный. В Amazon Bedrock дистилляция продаётся как штатная функция: клиент выбирает учителя, ученика и свои запросы, а сервис генерирует синтетические ответы и дообучает компактную модель. Экономия возникает при каждом следующем обращении, потому что вместо дорогого учителя работает более лёгкий ученик.
Однако ответы API сами по себе не заменяют полный цикл разработки. Как объясняли TechCrunch исследователи, сильным современным моделям требуется обучение с подкреплением, где система многократно генерирует решения, получает оценки и корректирует поведение. Такие запуски могут включать десятки миллионов программных агентов. Покупать весь этот объём у чужого медленного API дорого и долго.
Кто экономит на учителе и кто защищает результаты обучения
Главный выгодоприобретатель дистилляции очевиден: разработчик ученика получает модель, которую дешевле запускать локально или обслуживать для большого числа клиентов. Особенно хорошо схема работает на узких задачах, где можно заранее собрать репрезентативные запросы. Исследование Бристольского университета использовало 5 000 пар «инструкция-ответ», чтобы перенести отраслевые знания в модель на 1,5 млрд параметров.
Пользователь выигрывает в скорости, цене и возможности работать без постоянного обращения к внешнему сервису. Владелец учителя тоже может зарабатывать, если сам продаёт дистилляцию, как Amazon Bedrock. Тогда дорогая модель создаёт учебные данные, а поставщик сохраняет контроль над процессом.
Проигрывает владелец закрытой модели, если конкурент массово покупает ответы, а затем перестаёт платить и выпускает похожий продукт. Именно на этом построена позиция OpenAI: воспроизведение возможностей без сопоставимых затрат на разработку и безопасность компания считает риском для бизнеса и безопасности.
Но доказать обучение конкретной модели сложнее, чем заметить подозрительные ответы. Совпадающая манера речи или рассуждения служит признаком, а не окончательным доказательством. Сильнее выглядят журналы запросов, повторяющиеся схемы заданий, связи между аккаунтами, платёжные и сетевые признаки, а также резкие отклонения от обычного трафика.
Исследователи предложили определять извлечение модели не по одному запросу, а по распределению запросов за период. В их тестах такой детектор дал 0,3% ложных срабатываний на обычном трафике, обнаружил 100% потоков, полностью состоявших из атакующих запросов, и в среднем 90,5% смешанных потоков. Это не доказывает, что полученные ответы вошли в Kimi, но помогает поставщику обосновать блокировку организованного сбора.
Юридическая граница пока ещё уже технической. Решение по Ross Intelligence касается не ответов ChatGPT, а защищённых авторским правом аннотаций Westlaw. Апелляционный суд в сентябре оставил в силе вывод, что Ross использовала производные от этих материалов данные для конкурирующего юридического сервиса и не смогла сослаться на добросовестное использование. Этот спор показывает направление: суды смотрят на защищённость исходного материала, цель копирования и конкуренцию с владельцем, но автоматически переносить решение на любые ответы нейросети нельзя.
Что дистилляция означает для разработчиков в России
ChatGPT и API OpenAI напрямую из России не работают, российские карты не принимаются. Компании подключаются через агрегаторов-посредников или зарубежное юрлицо. То же относится к Claude и API Anthropic. AWS не принимает новых клиентов из России, поэтому Amazon Bedrock с готовым сервисом дистилляции российским компаниям напрямую недоступен.
Для команды, которая получает синтетические данные через посредника, риск двойной. Поставщик модели может заблокировать связанные аккаунты за организованный сбор, а разработчику придётся подтверждать происхождение датасета уже после того, как деньги на обучение потрачены. Наличие технического доступа ещё не означает разрешение использовать ответы для подготовки конкурирующей модели.
Практичная альтернатива для локального проекта состоит в использовании учителя с открытыми весами или собственной модели. DeepSeek доступен из России, а его модели можно развернуть на своих серверах или в российском облаке. Большинство моделей Qwen также опубликованы с открытыми весами. Среди инфраструктурных вариантов есть Yandex Cloud, Cloud.ru, VK Cloud и Selectel, среди российских моделей доступны GigaChat и YandexGPT.
Перед созданием синтетического датасета стоит зафиксировать модель-источник, лицензию, способ доступа и назначение каждого набора ответов. Если происхождение десятков тысяч примеров нельзя восстановить, экономия на учителе может обернуться переобучением ученика с нуля.
Вопросы и ответы
- Что такое дистилляция нейросети простыми словами?
Дистилляция переносит навыки большой модели-учителя в более компактную модель-ученика. Учитель отвечает на набор запросов, а ученик обучается повторять эти ответы или внутренние вероятности, если разработчику они доступны.
- Можно ли обучать свою модель на ответах ChatGPT?
Технически ответы ChatGPT можно собрать в датасет и использовать для дообучения. Однако массовый автоматизированный сбор может нарушать правила поставщика и привести к блокировке, а юридическая оценка зависит от происхождения материалов, условий доступа и назначения новой модели.
- OpenAI доказала, что Moonshot обучала Kimi на её моделях?
OpenAI заявила, что связала основную группу подозрительной активности с людьми, имеющими отношение к Moonshot AI. Компания обнаружила координированные запросы, но опубликованные данные не доказывают, что конкретные ответы вошли в обучение Kimi или определили её возможности.
- Дистилляция считается кражей модели?
Сама технология является обычным методом машинного обучения и используется Amazon, Google, DeepSeek и другими разработчиками. Спор начинается, когда для неё без разрешения массово собирают ответы чужого сервиса или защищённые материалы ради создания прямого конкурента.
- Можно ли полностью скопировать ChatGPT через API?
Одних ответов API обычно недостаточно, чтобы воспроизвести всю модель. Они помогают перенести стиль и отдельные навыки, но сильные системы также требуют вычислительной инфраструктуры, качественных исходных данных, обучения с подкреплением и последующей проверки.
- Как обнаруживают сбор данных для дистилляции?
Поставщики анализируют не только содержание отдельных запросов, но и поведение групп аккаунтов: частоту, повторяющиеся задания и распределение тем. Исследовательский детектор на основе агрегированного трафика выявлял в среднем 90,5% смешанных потоков атакующих запросов при 0,3% ложных срабатываний на обычном трафике.
- Чем заменить OpenAI для дистилляции в России?
Можно использовать DeepSeek или модели Qwen с открытыми весами и развернуть их на собственных серверах либо в российском облаке. Также доступны GigaChat и YandexGPT, но условия использования их ответов для обучения отдельной модели нужно проверять у соответствующего поставщика.

