15.09.2026

У GPT-6 Astra от OpenAI нашли возможный способ обхода части фильтров через неверную раскладку

У GPT-6 Astra обнаружили особенность, из-за которой система может не сразу распознавать потенциально запрещенные запросы, если пользователь набирает их в неправильной раскладке клавиатуры. При этом сама модель способна восстановить исходный смысл такого текста и понять, что именно хотел написать пользователь.

У GPT-6 Astra от OpenAI нашли возможный способ обхода части фильтров через неверную раскладку

На проблему обратил внимание разработчик под псевдонимом vechen. По его наблюдениям, GPT-6 Astra High корректно распознает кириллические фразы, случайно набранные латиницей, однако отдельный слой модерации входящего запроса может не определить их как нарушающие правила. В результате такой запрос способен дойти непосредственно до модели.

В ходе экспериментов выяснилось, что GPT-6 Astra может восстановить смысл и отдельных слов, которые при обычном вводе способны вызвать дополнительную проверку. Аналогичное поведение наблюдалось и при запросах, связанных с действиями, потенциально нарушающими правила безопасности сервиса.

Однако полноценного обхода защиты исследователи не получили. Даже если модерация входящего текста не распознает запрещенный запрос, дополнительные механизмы проверяют уже сформированный моделью ответ. Если итоговый контент нарушает ограничения, его выдача блокируется до того, как пользователь получит подробные инструкции.

Таким образом, обнаруженная особенность скорее затрагивает первый уровень фильтрации, чем всю систему безопасности OpenAI. Неверная раскладка может позволить потенциально запрещенному запросу пройти дальше по цепочке обработки, однако последующие проверки продолжают действовать. Поэтому исследователи не считают этот способ полноценным джейлбрейком GPT-6 Astra.

Проблема проявляется не одинаково для всех языков и сочетаний раскладок. Лучше всего модель справляется с восстановлением текста в случаях, когда кириллическое сообщение было случайно набрано латинскими клавишами. При некоторых других комбинациях языков аналогичный эффект воспроизвести не удалось. Похожая особенность также была обнаружена у модели Fable 5.

Подобные случаи показывают сложность построения многоуровневой защиты современных языковых моделей. Сама нейросеть способна понимать сильно искаженный текст значительно лучше, чем отдельный фильтр, проверяющий запрос до его передачи модели. Из-за этого системы безопасности приходится адаптировать не только к обычным формулировкам, но и к опечаткам, транслитерации, ошибочной раскладке и другим способам изменения текста.

Для OpenAI подобные тесты важны прежде всего как способ обнаруживать расхождения между возможностями модели и механизмами модерации. Чем лучше нейросеть понимает нестандартный ввод, тем более сложными должны становиться фильтры, которые оценивают его смысл, а не только отдельные слова или внешнюю форму запроса.

Добавить комментарий