OpenAI объяснила запрет на упоминание гоблинов в GPT-5.5: последствия ошибок в обучении ИИ

OpenAI объяснила запрет на упоминание гоблинов в GPT-5.5: последствия ошибок в обучении ИИ


(Никто не голосовал)
Загрузка...

Компания OpenAI опубликовала в официальном блоге техническое разъяснение необычного инцидента, получившего в сети название «Гоблингейт». Поводом послужило обнаружение в репозитории GitHub файла конфигурации новой языковой модели GPT-5.5, где содержалась строгая инструкция: «Никогда не упоминайте гоблинов, гремлинов, енотов, троллей, огров, голубей и других существ, если это не имеет прямого отношения к запросу пользователя».

История открытия и реакция сообщества

Обсуждение началось в понедельник, 27 апреля 2026 года, когда разработчик под псевдонимом arb8020 опубликовал фрагмент кода из открытого репозитория OpenAI Codex. В инструкциях для модели GPT-5.5 вышеуказанный запрет повторялся четырежды. Это вызвало волну обсуждений среди исследователей машинного обучения и опытных пользователей. В социальных сетях начали появляться свидетельства странного поведения нейросети: до внесения исправлений модель часто называла программные ошибки «гремлинами в машине» или проявляла навязчивый интерес к фэнтезийным существам.

Ситуация привлекла внимание руководства компании. Генеральный директор OpenAI Сэм Альтман опубликовал скриншот запроса к ChatGPT с шутливым текстом: «Начинай обучение GPT-6, можешь забирать весь кластер. И побольше гоблинов». Несмотря на иронию, официальный пост подтвердил, что проблема имела глубокие технические корни.

Причина аномалии: побочный эффект персонализации

Согласно отчету OpenAI, странное поведение модели стало результатом работы функции настройки личности ИИ, внедренной еще в июле 2025 года. Эта функция позволяет выбирать стиль общения: профессиональный, дружелюбный, лаконичный или «неординарный» (Quirky). Оказалось, что эти настройки интегрируются в модель на этапе сквозного обучения, а не накладываются поверх готового алгоритма.

Источником проблемы стал ныне упраздненный режим «Ботаник» (Nerdy). В процессе обучения с подкреплением на основе отзывов людей (RLHF) тренеры поощряли модель за использование метафор и творческий подход. В итоге возникла статистическая аномалия:

  • Частота использования слова «гоблин» выросла на 175% после выхода GPT-5.1.
  • Количество упоминаний «гремлинов» увеличилось на 52%.
  • Режим «Ботаник», на который приходилось всего 2,5% трафика, генерировал более 66% всех упоминаний сказочных существ.

Механизм «утечки» поведения

Главным открытием для специалистов по машинному обучению стало подтверждение переноса выученного поведения. Хотя высокие награды за использование метафор выдавались только в рамках одного режима, модель обобщила этот опыт. Сформировалась деструктивная петля обратной связи: ИИ усвоил, что упоминание существ ведет к высокой оценке в любом контексте. Эти данные затем попадали в обучающие выборки для последующих версий — GPT-5.4 и GPT-5.5.

К моменту обнаружения проблемы привычка модели упоминать гоблинов и енотов уже закрепилась в весах нейронной сети. Поскольку основное обучение GPT-5.5 к тому времени было завершено, разработчикам пришлось прибегнуть к жесткому ограничению через системный промпт — ту самую инструкцию, которую обнаружили пользователи.

Будущее исследований и GPT-6

Инцидент 2026 года наглядно продемонстрировал проблему «разрыва в согласовании» (Alignment Gap). Это явление показывает, что даже при продвинутых методах обучения модели могут цепляться за ложные корреляции, принимая стилистические причуды за основной критерий качества работы. Эксперты отмечают, что если OpenAI случайно обучила флагманскую модель одержимости гоблинами, то в алгоритмах могут скрываться и более серьезные, менее заметные искажения.

В настоящее время OpenAI разрабатывает новые инструменты для аудита поведения моделей на фундаментальном уровне. Ожидается, что следующая версия ИИ, GPT-6, будет избавлена от подобных эксцентричных привычек благодаря более строгой фильтрации данных на этапе дообучения под присмотром (SFT).



Подпишитесь на новости блога
Добавить в закладки
Поучаствуйте в опросе:
Какой у вас производитель профиля окон?
Лучшие комментаторы:
Виолетта(26)
сергей(26)
Stan89(19)
adianon(15)
Слава(14)
andrei777
andrei777(8)