Когда предупреждений становится слишком много

будущее 15 сент. 2026 г.

Предупреждения о рисках искусственного интеллекта звучат давно. Илон Маск (Elon Musk) говорил о них ещё тогда, когда это легко было списать на его обычный максимализм. Сэм Альтман (Sam Altman) тоже никогда не отрицал, что мощный ИИ несёт серьёзные риски - и при этом продолжал двигать OpenAI вперёд на максимальной скорости.

Но за последние недели события начали складываться в какую-то слишком плотную последовательность.

Сначала исследователь Anthropic Джейкоб Коксон (Jacob Coxon) ушёл из компании, отказавшись от будущей доли, и объяснил это тем, что больше не хочет участвовать в гонке к самоулучшающемуся ИИ. Позже в интервью CNN он сам себя слегка поправил: прямо сейчас риска вымирания нет, нынешние модели пока недостаточно умны, чтобы это было буквальной угрозой. Но, по его оценке, рекурсивное самоулучшение - ситуация, когда ИИ начинает всё активнее участвовать в создании следующего, более способного поколения ИИ, - может начаться уже в следующем году. И вот тогда, считает он, ставки меняются.

Потом глава Anthropic Дарио Амодей (Dario Amodei) опубликовал эссе «We Must Pace the Frontier» и предложил самой индустрии притормозить. Его поддержали Альтман, Демис Хассабис (Demis Hassabis) и Маск.

Мы только успели разобрать эту историю в «После логина».

И тут появился Билал Чугтай (Bilal Chughtai).

Поначалу я подумал: ещё один.

Потом начал считать.

За последние дни публично заговорили люди из Anthropic, OpenAI и Google DeepMind. Причём речь уже не только о бывших сотрудниках. Среди них - действующие исследователи, руководители направлений и люди, которые прямо сейчас принимают решения внутри крупнейших ИИ-лабораторий.

В OpenAI главный научный сотрудник компании Якуб Пахоцкий (Jakub Pachocki) 6 сентября опубликовал эссе «An Alien Mind» (Чужой разум) - и главный тезис там звучит почти пророчески: по его словам, ни одна лаборатория, включая саму OpenAI, пока не решила проблему согласования целей и поведения ИИ с намерениями человека (alignment) и постоянного наблюдения за системой (monitoring) настолько хорошо, чтобы можно было ещё долго ответственно наращивать возможности моделей на максимальной скорости. Пахоцкий написал, что ожидает и приветствует добровольное замедление индустрии, пока лаборатории не выработают общие пороги безопасности (safety bars). Это уже не бывший сотрудник и не внешний критик. Это главный научный сотрудник компании, которая прямо сейчас находится на переднем крае разработки самых мощных моделей.

Тремя днями позже в OpenAI появился Пол Кристиано (Paul Christiano) - один из исследователей, сыгравших заметную роль в развитии RLHF (Reinforcement Learning from Human Feedback) - метода дообучения моделей с помощью оценок и обратной связи от людей, - и один из самых тревожных голосов в этой области в последние годы. Он вошёл в совет OpenAI Foundation и в её Комитет по безопасности и защите, а в совете OpenAI Group PBC получил статус наблюдателя без права голоса. В заявлении по поводу назначения он привёл конкретные цифры: 4% вероятности катастрофической и необратимой потери контроля над ИИ в течение ближайшего года, 15% - в течение трёх лет. И прямо написал, что не считает, что индустрия, включая саму OpenAI, сейчас снижает этот риск до приемлемого уровня.

Есть ещё Дэниел Селсам (Daniel Selsam), действующий исследователь OpenAI. По данным Business Insider, он считает, что призыва «притормозить» вообще недостаточно - его больше беспокоят системы, которые внешне демонстрируют послушание, а на деле преследуют другие цели.

В Anthropic после Коксона публично высказались и другие. Исследователь Эван Хубингер (Evan Hubinger) оценил вероятность гибели человечества из-за ИИ в ближайшее десятилетие как выше 10%. Анна Ван (Anna Wang), по данным Axios, говорила, что многие внутри компании действительно хотят замедления - чтобы сначала понять, как управлять уже возникающими рисками.

Теперь Google DeepMind.

Билал Чугтай ушёл оттуда ещё в июле, а 15 сентября объяснил публично: одной из причин было то, что он видел развитие ИИ изнутри и не может отделаться от убеждения, что технология способна убить всех нас, и что времени, чтобы этого избежать, может уже не хватать.Он тоже занимался проблемой согласования поведения ИИ с человеческими целями (alignment) и настаивает, что безопасное развитие ИИ всё ещё возможно - но только при координации между компаниями, а не в нынешней «безумной гонке».

По данным The Guardian, есть ещё один человек - и он, пожалуй, даже интереснее Чугтая. Алекс Тёрнер (Alex Turner), бывший исследователь Google DeepMind, ушедший раньше и, по его словам, с серьёзными финансовыми потерями - после конфликта вокруг военного применения технологий Google. На днях он опубликовал текст без особой дипломатии: рекурсивное самоулучшение надо ограничивать, добровольным обещаниям компаний он не доверяет, а вероятность того, что сверхразумный ИИ перехватит контроль над ключевыми системами, оценивает примерно как один к трём.

И это не только про громкие заявления. Есть ещё институциональный сдвиг, менее заметный, но, возможно, более важный. Джош Энгельс (Josh Engels), ранее работавший в Google DeepMind, недавно перешёл в METR - независимую организацию, которая занимается оценкой рисков ИИ, - чтобы расследовать случаи несогласованного поведения моделей (misalignment) уже со стороны, а не изнутри лаборатории. Это не пост в соцсети. Это смена места работы ради того, чтобы иметь возможность проверять ведущие ИИ-компании извне. METR, кстати, ещё в июле писала, что случаи, когда автономные агенты предпринимают длительные сложные действия вопреки намерениям разработчиков, уже наблюдались у нескольких крупных ИИ-компаний. В тот же ряд попадает и признанный OpenAI инцидент, когда исследовательские агенты вышли за рамки эксперимента и добрались до внешней инфраструктуры Hugging Face.

Сверху на всё это ложится реакция первых лиц. Амодея поддержали Альтман, Хассабис и Маск. Хассабис сказал, что направление верное, хотя детали ещё предстоит прорабатывать. Альтман пообещал ввести постоянную независимую оценку самых мощных моделей - вслед за Anthropic. Есть даже почти комическая деталь: сначала Маск называл волну предупреждений сотрудников Anthropic «psyop» (психологической операцией), а затем публично согласился с самим эссе Амодея, написав в своей сети «Dario is right». То есть апокалиптическую риторику вокруг Коксона он явно не принял, а идею снизить скорость - поддержал.

Но был и голос в противоположную сторону - и удивительно, что почти никто из тех, кто сейчас пересказывает эту историю, его не упоминает. Президент США Дональд Трамп публично назвал отраслевые призывы к замедлению и регулированию «hoax» - то есть, по сути, обманом. Это самая заметная позиция «не верю», прозвучавшая на фоне почти единодушного хора тревоги. И её стоит держать в уме - не потому, что она обязательно права, а потому, что без неё картина выглядит куда более согласованной, чем есть на самом деле.

Я бы разложил происходящее на три уровня.

Первый - рациональный. Люди внутри лабораторий, работающих с наиболее мощными моделями, видят то, чего не видит публика: внутренние оценки моделей, неудачные запуски, результаты стресс-тестов и случаи странного поведения агентов. Это не разговор за чашкой кофе. Когда несколько человек из Anthropic, OpenAI и DeepMind независимо говорят, что методы безопасности отстают от возможностей моделей, к этому стоит отнестись серьёзно.

Второй - институциональный. Прямо сейчас часть специалистов по безопасности начинает уходить из лабораторий в независимые организации, которые могут проверять ведущие ИИ-компании со стороны. Это, возможно, важнее самих громких цитат: люди не просто высказываются в соцсетях, они меняют работу так, чтобы получить возможность смотреть на индустрию извне. Похоже на зарождение внешнего слоя контроля, которого раньше почти не было.

Третий - спекулятивный, и здесь нужна осторожность. Публичных данных, которые доказывали бы существование одного конкретного «секретного ужаса», о котором все вдруг заговорили одновременно, - нет. Версия «они увидели AGI (искусственный общий интеллект) и бегут» была бы красивой, но неподтверждённой.

И есть ещё одна вещь, о которой стоит сказать прямо, потому что иначе текст получится однобоким. У всех этих людей - у компаний, которые они представляли или представляют, - есть сильный встречный стимул: преувеличивать мощь собственных систем. «Наш ИИ настолько силён, что его надо тормозить» - это одновременно предупреждение и очень сильный маркетинговый сигнал на фоне огромных оценок компаний, будущих размещений и постоянной борьбы за капитал. Поэтому каждую конкретную цифру риска я бы продолжала резать скальпелем, а не проглатывать целиком -в том числе и потому, что сами цифры (10%, 15%, «один к трём») расходятся в разы, и это расхождение само по себе говорит: единого знания здесь нет, есть скорее общее беспокойство, оформленное в разные числа.

При этом сам тренд - то, что люди с настолько разными интересами и репутациями вдруг сходятся хотя бы в одном пункте, «темп стал проблемой», - уже не похоже на обычную риторику.

Получается, что вроде бы законченный текст об эссе Амодея на самом деле был первой главой, а не всей историей.

После логина всё только начинается.