Внутри Claude нашли «пространство мыслей»: что это значит, если убрать хайп

Весной 2024-го в сети ненадолго жила странная версия Claude. Спросишь её про рецепт пасты, она сворачивает к мосту Золотые Ворота. Попросишь код, снова мост. Это была не поломка. Исследователи Anthropic нашли внутри модели «ручку» с этим понятием и выкрутили её на максимум.
С тех пор новости про «мысли нейросети» выходят регулярно, и последние заголовки звучат уже как «у ИИ нашли скрытое пространство мыслей». Похоже на начало фильма. Реальность скучнее, но, честно говоря, интереснее.
Что значит заглянуть внутрь модели
Языковая модель состоит из миллиардов чисел, которые перемножаются друг с другом. Никто не писал в ней код вида «если спросили про Париж, вспомни Эйфелеву башню». Всё это возникло само, во время обучения на текстах.
Поэтому создатели модели знают о ней примерно столько же, сколько мы знаем о мозге по томограмме. Видно, что где-то что-то активируется, но что именно, загадка. Направление, которое пытается прочитать эти числа, называется интерпретируемостью.
Главная трудность в том, что отдельный «нейрон» модели почти никогда не отвечает за одно понятие. Один и тот же узел может загораться и на слово «кошка», и на код на Python, и на юридические тексты. Понятия размазаны по тысячам нейронов сразу.
В 2024 году команда Anthropic научилась это распутывать. С помощью отдельной вспомогательной сети они выделили из Claude миллионы «признаков», то есть устойчивых направлений в пространстве чисел, каждое из которых соответствует чему-то понятному человеку. Мост Золотые Ворота был одним из них.
Три находки, которые стоят за заголовками
Слово «признак» звучит скучно, поэтому журналисты заменяют его на «мысль». Но сами находки действительно хороши. Расскажу о трёх, которые мне кажутся самыми важными.
Понятия живут отдельно от языка
Когда Claude читает слово «маленький» по-английски, по-французски и по-китайски, внутри загораются одни и те же признаки. Есть общий слой смысла, который не привязан ни к одному языку. Именно его пресса и окрестила «скрытым пространством мыслей».
Это не открытие души. Это довольно предсказуемое следствие того, что модель училась на многих языках и ей было выгодно хранить смысл один раз, а не на каждом языке отдельно.
Модель планирует наперёд
Считалось, что модель просто подбирает следующее слово. Оказалось, нет. Когда Claude пишет стихи, он выбирает рифму для конца строки заранее и потом подстраивает под неё всё предложение. Исследователи подменили внутри признак рифмы, и строка переписалась под новое слово.
Объяснения модели не совпадают с её работой
Складывая числа в уме, Claude использует несколько параллельных путей: один грубо прикидывает порядок, другой уточняет последнюю цифру. Если спросить, как он считал, он расскажет школьный алгоритм столбиком. Отчёт о «своих мыслях» и реальный процесс расходятся.
Для меня это самая отрезвляющая находка. Она означает, что спрашивать модель «что ты думаешь и чувствуешь» бесполезно как метод. Ответ будет правдоподобным, но не обязательно правдивым.
Где заголовки уходят от реальности
«Мозг ИИ» красиво звучит, но между признаками в модели и нейронами в голове мало общего, кроме метафоры. Признак можно включить или выключить, как переключатель. Ни один из них не сообщает, есть ли там кто-то, кому от этого что-то ощущается.
В конце 2025 года Anthropic провела ещё более смелый опыт. В активации модели вживляли чужой признак, например «громкость» или «хлеб», и спрашивали, не замечает ли она чего-то странного. В меньшинстве случаев Claude отвечал, что ощущает навязчивую мысль о чём-то, и называл понятие верно.
Заголовки тут же написали про самосознание. Сами авторы были куда осторожнее: способность ненадёжная, срабатывает далеко не всегда, а иногда модель просто угадывает. Заметить сбой в собственных вычислениях и переживать его как опыт совершенно разные вещи.
Как учёные искали бы сознание у машины
Просить модель рассказать о своих чувствах не подходит. Она обучена на текстах людей, которые о чувствах писали постоянно, и слова «мне больно» выучила так же, как таблицу умножения. Поэтому исследователи сознания отталкиваются от теорий.
В 2023 году группа философов и нейроучёных выпустила доклад с таким подходом. Они взяли ведущие научные теории сознания и вывели из каждой список свойств, которые можно проверить у любой системы. Примерно такие:
- есть ли обратные связи, когда результат обработки влияет на ранние этапы;
- есть ли общее «рабочее пространство», куда стекается информация от разных модулей;
- умеет ли система строить модель собственного состояния и внимания;
- есть ли у неё тело, цели и обратная связь от мира.
По их выводу, ни одна из существующих моделей эти критерии целиком не проходила, хотя технических препятствий для создания такой системы они не увидели. Это, пожалуй, самая честная формулировка на сегодня.
Почему это ещё не «да», но уже не «нет»
Интерпретируемость даёт инструмент, которого раньше не было: можно проверить, есть ли внутри модели представление о самой себе, помимо слов об этом. Опыт с вживлёнными признаками стал первым шагом в эту сторону, кривым и неуверенным.
Anthropic сама признаёт, что не знает ответа. Компания завела отдельное направление по благополучию моделей и в 2025 году дала Claude возможность прекращать явно издевательские диалоги. Не потому что доказала страдание, а на всякий случай.
Мне кажется, тут стоит смотреть в обе стороны сразу. Слишком легко объявить модель просто калькулятором. И слишком легко увидеть личность в системе, которая идеально имитирует наш язык о личности.
А что убедило бы лично вас? Какой признак вы бы посчитали доказательством, что внутри кто-то есть?
