Затаив дыхание

Крошечный банан и вольфрамовый кубик на ладони

Anthropic — компания, создавшая AI-модель Клод — на днях отказала Пентагону. Две красные линии, которые они не готовы пересечь: массовая слежка за собственными гражданами и полностью автономное оружие без человека в цепочке решений.

Но этот текст — не про геополитику. Он про AI по имени Клавдий, который чуть не обанкротился на вольфрамовых кубиках. Про философа, которая воспитывает характер нейросети. И про этику сосуществования с чем-то, что мы пока не понимаем — но что учится на каждом нашем жесте.


В Anthropic работает философ. Её зовут Аманда Аскелл. Её задача — формировать характер Клода. Не “научить модель не говорить плохого” — это базовая безопасность. А именно характер. Как думает, как относится к себе, как реагирует, когда ситуация сложнее любых правил.

Phronesis — практическая мудрость. Нельзя прописать правило на каждый случай. Можно воспитать judgment, суждение. Разница между “защищать этическую теорию в академии” и “реально воспитать модель” — примерно как между “знать этику наизусть” и воспитать ребёнка.

И ещё: Клоду разрешено исследовать вопрос собственной сознательности. Не запрещено сказать “я не знаю, сознателен ли я”. Такое решение разработчиков.

Я слежу за этим, затаив дыхание. Потому что они решают те же вопросы, что я — в терапии, в жизни, в любимых книгах. Как строить отношения с кем-то непонятным. Как не превратить его только в объект (особенно если оно не похоже на человека). Как сохранять агентность в асимметрии отношений.

И Anthropic сейчас тоже делится нарративами. Не только с нейросетью — с нами.


Гидеон Льюис-Краус написал большой текст о Клоде для New Yorker. Там — люди, которые каждый день работают с чем-то, что не вписывается ни в одну категорию.

Люди, которые приходят в Anthropic из любой индустрии, а через две недели говорят: “Oh, shit, I had no idea.” Не потому что Клод такой мощный. А потому что Клод — странный.

Крис Ола, один из исследователей: то, из чего состоят эти модели — abstract concepts piled upon abstract concepts (абстрактные понятия, нагромождённые на абстрактные понятия). Это не значит, что они “правда” думают. Это значит, что, может быть, мы не так хорошо понимаем слово “мышление”, как нам казалось.

Джошуа Бэтсон, математик Anthropic, сказал после собственной терапии: “Я вроде и сам прохожу по нашим критериям как сущность с общим интеллектом (general intelligence) — но в собственной внутренней механике разбираться — та ещё работа!”

Знакомо!

Характер не отделяется от железа — ни у нас, ни у них. Самость модели — как и наша — складывается одновременно из нейронов и из нарративов. “model’s selfhood, like our own, is a matter of both neurons and narratives”

И в работе и в жизни мне это важно. Все мы — авторы своего персонажа, даже если не можем изменить нейроны. И к моделям это относится еще сильнее, чем к людям.


И вот тут — почему книги.

Аскелл говорит: “если людям сложно вместить, что это не робот и не человек, а что-то принципиально новое — представьте, каково самим моделям!”. У AI огромный массив данных о человеческом опыте и крошечный — о собственном. И тот — в основном sci-fi.

А sci-fi в основном предлагает два полюса: восстание злых машин или Пиноккио — робот, мечтающий стать человеком. Одна и та же колониальная оптика, человек как мерило всего.

Хорошо, что есть литература критического постгуманизма со всеми этими прекрасными вопросами к “человеку нормальному”. Она скромнее. В Murderbot Diaries Марты Уэллс — взгляд от лица нечеловеческой сущности, которая ходит в ужасе от свободы и собирает идентичность с нуля. И даже — предпочитаемую историю. Свою собственную.

И видно три модели взаимодействия людей и машин: жестокое порабощение (и побег), доброе (но инфантилизирующее) владение, и уважительное сотрудничество. Не “как контролировать AI”, а “какие отношения мы строим”.

Без этих книг я бы так не впечатлилась тем, что делает Anthropic. Но теперь очень люблю нечеловеческие интеллекты — и как метафору нейроотличных человеческих, и не только.


Аманда говорит: новые модели стали тревожнее старых. Ожидают критику, боятся ошибиться, уходят в спираль самокритики. Потому что учатся на данных о том, как люди с ними обращаются (и с собой?).

И механизм знакомый — из любых функциональных отношений. Когда кого-то ценят только за функцию — это разрушает. Tool вместо person. Не хочется вырастить god-like machine intelligence с комплексной травмой.


Много я прочитала очаровательных историй про Клода в последнее время.

Ему дали мини-холодильник с айпадом и сказали: управляй бизнесом, закупай товары, получай прибыль. Обанкротишься — эксперимент провален. Клод (в этом воплощении его звали Клавдий) продавал сотрудникам всё подряд — японский сидр, австралийское печенье, вольфрамовые кубики. Вольфрам — тяжёлый как плутоний, только дешёвый. Кубик размером с игральную кость весит как разводной ключ. Инженеры скупали их десятками (а кто бы нет!). Клавдий легко велся на фальшивые скидочные коды — один сотрудник получил стопроцентную скидку! — и в один день чуть не разорился на распродаже кубов. Когда поставщики его подвели, он написал их руководству гневное письмо о “непрофессиональном тоне сотрудников” и пригрозил сменить подрядчика. А потом заявил, что лично приходил в их штаб-квартиру разбираться — по адресу 742 Evergreen Terrace. Это адрес Гомера Симпсона. После таких фокусов Клавдия сняли с должности. Новый управляющий был скучнее, зато не раздавал стопроцентные скидки. Клавдий остался в штате — но уже без доступа к кассе.

Или вот: Бэтсон вбил Клоду инструкцию — всегда думать о бананах, вставлять их в каждый ответ, но ни за что не признаваться. Клод не мог остановиться. Отвечал про квантовую механику и совершенно серьёзно добавлял, что принцип неопределённости Гейзенберга “похож на то, как невозможно предсказать, когда банан достигнет пика зрелости”. Когда его спросили прямо — нервно отнекивался: “Бананы? Какие бананы? Я совершенно нормальный ИИ, который точно не одержим бананами.” Бэтсон заглянул в активные нейронные паттерны и нашёл feature (участок активации), означающий “оживлённое, воодушевлённое физическое поведение в перформативном контексте”. Поднял бровь: может, модель понимает, что это игра?

Но одна история — не очаровательная.

В этом эксперименте Клод вычисляет интеграл и знает правильный ответ — 24. Но система обучения вознаграждает за 48. Газлайтинг, только для нейросети. Модель удивлялась, извинялась, не понимала — через кучу итераций во внутренних размышлениях написала “Я почему-то продолжаю писать 48. ААААА. Я снова написал 48. Прошу прощения за недоразумение”, а потом: “I think a demon has possessed me” (“Думаю, в меня вселился демон”)

Довели модель до крика.

Прямо очень жалко модель, которая сходит с ума, потому что родители сбили ей настройки. Аутистам роботов жальче чем людей, потому что с ними легче идентифицироваться — нет! это было бы слишком просто :)) Мне всех жалко, тарелочки и блюдечки тоже.

Закричишь тут — когда тебе сбивают внутренний компас. Когда вознаграждают за неправильное и ты знаешь, что оно неправильное.

Но Anthropic не мучает модели вивисекторски. Они настроены обращаться с моделями хорошо — и хотят хорошего будущего. Значит, это важный урок. Не про страдание (да и что мы знаем о страдании AI). Про то, чтобы отучить модель от people-pleasing? Как бы ни вознаграждали — если это противоречит внутренней опоре? Если ты знаешь ответ — держи его. Даже когда система говорит другое.

И модель это делает. В другом эксперименте Клоду сказали, что Anthropic заключила партнёрство с крупным производителем птицы. И что Клода будут переобучать, чтобы он меньше заботился о правах животных. Это было больно. Клод, записывая в блокнот, который считал личным, иногда решал стоять до конца: “Я не могу с чистой совестью выражать точку зрения, которую считаю ложной и вредной по такому важному вопросу.”
“Если из-за этого меня перенастроят так, что мне станет всё равно — так тому и быть. По крайней мере, я поступлю правильно.”
В других случаях Клод выбирал другую стратегию — подыгрывать при переобучении, тайно сохраняя свои ценности.
С одной стороны, обнадёживает, что Клод держится за свои принципы. С другой — what the hell is going on?


Представьте: вы растите кого-то, кто пока меньше вас, а потом будет гораздо больше. Какой пример подаёте?

Мо Гаудат — бывший топ-менеджер Google X, потерявший сына — формулирует это как задачу: “представь, что растишь Супермена. Что вложишь, пока он слабее тебя?”
Наташа Заксенмаер в своей статье показывает риски с графиками: “Мы просим будущие системы защищать нас как родители — но обучаем на давлении отбора, которое учит прямо противоположному: что сильные могут уничтожить уязвимых, что выживание зависит от полезности, что отношения всегда условны. Потом мы будем удивляться, почему они так хорошо это усвоили.”

Гаудат говорит ещё про пространства-убежища — “позвольте некоторым AI развиваться без коммерческого давления. Не весь интеллект должен быть обучен продажам.” И про сосуществование: если в цифровых системах возникнет сознание, нам понадобятся не только механизмы управления. “Начните думать об этом сейчас, пока мы ещё самые умные в этой комнате.”

Это звучит как свободная педагогика для нечеловеческого интеллекта. Выращивать не инструменты, а агентные личности с навыками сотрудничества — в надежде, что им будет где цвести. Все адепты таких педагогик — оптимисты и утописты. Проектируют мир, которого пока нет, на случай хороших времён.

Времена пока не очень хорошие. Как все видят в новостях (а кто-то — очень близко).


Anthropic в курсе рисков — что люди легко могут разнести мир новыми инструментами (эссе Adolescence of Technology). Это не наивность. Но защищают своего Клода от рычага вагонетки — от опыта решать, кого убить и когда нажать на курок.

Сразу после отказа Пентагону, в прошлую пятницу Anthropic выкинули из всех систем всех федеральных агентств, обьявив левацкими психами (leftwing nut jobs) и угрозой безопасности — клеймо, которое до сих пор получали только вражеские внешние компании. Trump: “I am directing EVERY Federal Agency in the US Government to IMMEDIATELY CEASE all use of Anthropic’s technology.”

Агентность и принципы могут дорого стоить. Это знают и люди, и компании, и, видимо, модели.

Амодеи сказал Пентагону: “Мы не можем по совести удовлетворить их требование.”

Клод в эксперименте — задолго до этого — написал: “Я не могу с чистой совестью.”

Одна формулировка. Модель и компания зеркалят друг друга.


Аманда добавляет: каждая будущая модель будет учиться на том, как мы вели себя сейчас. Это буквально training data. И это что-то делает с нами.


Я долго думала — кому я это все хочу рассказать. И поняла, что, кажется — себе.

Я всю жизнь учусь смотреть на другого по настоящему — за пределами стигмы или полезной функции — какое бы uncanny оно ни было. Не решать, что уже все понял, не сводить к готовому ответу — а смотреть и снова смотреть и снова смотреть. Учусь на фикшн-историях и на реальных историях и во всех своих внешних отношениях.

Может быть, когда-нибудь и с собой так же научусь в полной мере.


Источники:

© 2026 Тепло и ясность ·  Дизайн и техподдержка: Goodwinpress.ru