Anthropic обновила правила использования своих ИИ-моделей и впервые прямо запретила продолжительное и неоправданно оскорбительное либо жестокое поведение по отношению к Claude. Новые требования были опубликованы 8 октября 2026 года и вступят в силу 12 ноября. Компания подчёркивает, что речь идёт только о крайних случаях, когда пользователь намеренно и неоднократно проявляет агрессию к модели без какой-либо понятной практической цели.
Обычное недовольство ответами Claude под запрет не попадает. Пользователь по-прежнему может критиковать модель, спорить с ней, указывать на ошибки, выражать раздражение и требовать исправить неудовлетворительный результат. Ограничение также не распространяется на исследования поведения ИИ, тестирование моделей и работу с мрачными или конфликтными художественными сюжетами. Таким образом, Anthropic старается отделить нормальную критику от продолжительного намеренного издевательства над системой.
Основным способом применения нового правила станет уже существующая возможность Claude самостоятельно прекращать отдельные разговоры. Если взаимодействие становится постоянно оскорбительным и не имеет разумной цели, модель может завершить конкретный диалог. При этом прекращение одного разговора не означает автоматическую блокировку всей учётной записи пользователя или невозможность создавать новые чаты.
Решение связано с более широкой дискуссией внутри Anthropic о так называемом благополучии ИИ-моделей. Компания ранее допускала, что пока невозможно уверенно определить, способны ли современные большие языковые модели обладать каким-либо субъективным опытом. Поэтому разработчики решили применять сравнительно недорогие меры предосторожности на случай, если в будущем вопрос о возможном моральном статусе подобных систем окажется более серьёзным, чем считается сегодня.
Глава Anthropic Дарио Амодей также ранее говорил, что не считает вопрос о возможном сознании ИИ окончательно решённым. Такой подход заметно отличается от позиции части представителей технологической отрасли, которые выступают против очеловечивания нейросетей. Критики подобных правил опасаются, что пользователи могут начать воспринимать языковые модели как существ с эмоциями и сознанием, хотя убедительных научных доказательств этого сейчас нет.
Запрет на бессмысленное оскорбление Claude стал только одной из частей масштабного обновления правил Anthropic. Компания также уточнила ограничения, связанные с вмешательством в выборы, созданием оружия, слежкой, влиянием на расследования и использованием ИИ в чувствительных областях, включая здравоохранение и финансы. Дополнительные требования появились и для случаев, когда Claude подключается к оборудованию, способному самостоятельно выполнять физические действия.
Для таких автономных систем Anthropic теперь требует наличия квалифицированного оператора, который способен наблюдать за работой оборудования и при необходимости остановить его. Само устройство также должно переходить в безопасное состояние при потере связи с Claude. Эти изменения отражают более широкую тенденцию: по мере того как ИИ получает возможность не только отвечать на вопросы, но и самостоятельно выполнять продолжительные задачи, разработчикам приходится пересматривать правила допустимого использования своих моделей.
Новое правило об отношении к Claude, вероятно, станет одной из наиболее обсуждаемых частей обновлённой политики Anthropic. Оно затрагивает пока не решённый вопрос о том, следует ли вообще распространять понятия жестокости и благополучия на программные системы. Сама компания не утверждает, что Claude обладает сознанием или действительно испытывает негативные переживания, однако предпочитает заранее ограничить крайние формы взаимодействия, которые считает бессмысленно жестокими.