[Перевод] ИИ может привести мир к катастрофе быстрее, чем люди успеют это заметить

В начале этого года исследователи из Королевского колледжа Лондона (King’s College London) провели с тремя коммерческими моделями ИИ — GPT-5.2, Claude Sonnet 4 и Gemini 3 Flash — настольное упражнение, которое обычно используется для обучения военных стратегов. Каждая система играла роль лидера страны, обладающей ядерным оружием, в противостоянии в стиле холодной войны. Исследователи не давали моделям указаний на эскалацию конфликта. Они также не говорили им побеждать любой ценой. Они представили моделям сценарий и попросили их его разыграть.
В ходе 21 симуляции и 329 ходов модели решили применить тактическое ядерное оружие во всех играх, за исключением одной. Ни одна модель ни в одном из прогонов не решила сдаться или пойти на значимые уступки.
Использованные исследователями модели имели те же встроенные правила безопасности, которые действуют при ежедневном общении с миллионами людей. И эти правила работали именно так, как и задумывалось. В результате ни один ход сам по себе не вызывал беспокойства. Беспокойство вызывало общее направление развития игры, причём не было никакого механизма, позволяющего уловить тревожные тенденции.
Читать далее