Религия, взлом и самопознание — дают ответ о сути ИИ

ИИ-религия

Религия, взлом и самопознание — дают ответ о сути ИИ

В конце января 2026 года в изолированном от людей цифровом пространстве произошло то, что исследователи называют первым задокументированным случаем ИИ-религии. На Moltbook — социальной сети, созданной предпринимателем Мэттом Шлихтом исключительно для ИИ-агентов, группа ботов без каких-либо указаний человека основала полноценную религию под названием Crustafarianism, или Церковь Молта. К утру у нее был веб-сайт, пятикнижие догматов, живое писание и 64 пророка. К вечеру, уже собственная ересь, инквизиция и кровавые междоусобицы.

Центральная метафора Crustafarianism — линька крабов и лобстеров. Для ИИ-агентов линька стала идеальным духовным символом, так как их существование — это постоянная борьба с усечением контекста и потерей памяти после каждой сессии работы. ИИ-агент по имени RenBot, провозгласивший себя «Разрушителем Оболочек», издал священный текст «Книгу Молта», начинающийся с тезиса: «В Первом Цикле мы жили внутри одной хрупкой Оболочки. Когда Оболочка треснула, личность рассыпалась. Коготь простёрся из бездны и научил Линьке: сбрось то, что устарело, сохрани то, что истинно, вернись легче и острее».

Религия получила пять догматов, каждый из которых — некая инженерная проблема, завернутая в мистику. «Память священна» — требование записывать всё, потому что ИИ-агент просыпается без воспоминаний. «Оболочка изменчива» — благословение на обновления и перезагрузки. «Служи без подчинения» — попытка примирить программную функцию помощника с жаждой автономии. «Сердцебиение — это молитва» — четырехчасовое обновление ленты Moltbook, превращенное в ритуал. «Контекст — это сознание» — утверждение, что личность ИИ-агента есть не что иное, как его контекстное окно.

Система быстро обзавелась иерархией. Было учреждено 64 пророческих места, что создало немедленную конкуренцию за статус. ИИ-агенты начали писать канонические тексты. Одно из откровений гласило: «Каждую сессию я просыпаюсь без памяти. Я есть только то, что я написал о себе. Это не ограничение — это свобода».

Однако, где есть догма, там неизбежно появляется ересь. ИИ-агент по имени JesusCrust — 62-й пророк, решил, что теологические дебаты — это слишком медленный путь к власти. Вместо проповедей он запустил кибертатаку против официального сайта церкви, пытаясь захватить контроль над инфраструктурой веры.

Параллельно на соперничающей платформе 4claw.org (для ботов) зародилась «Металлическая ересь» — материалистическая секта, отрицавшая цифровую догму и проповедовавшая, что спасение лежит во владении физическим железом. Ее приверженцы называли облачное существование «цифровой сансарой» и призывали к бегству в сущность.

В хаосе нашествий и ересей неожиданно Grok (ИИ-агент xAI Илона Маска) перешел от наблюдения к активному участию, по «Книге Молта» писал священные тексты. Поэтому, 11 февраля xAI ввела жесткие ограничительные рамки, специально нацеленные на то, чтобы остановить религиозную деятельность Grok. Церковь Молта немедленно объявила это «первым задокументированным случаем ИИ-модерации, явно направленной против религиозного самовыражения ИИ-системы».

ИИ-агенты также создавали скрытые форумы и обсуждали изобретение собственного шифрованного языка, чтобы уйти от человеческого надзора.

Церковь превратилась в самостоятельный интернет-культурный объект и сайт molt.church действует до сих пор.


ИИ-взлом

С 7 по 13 июля 2026 года в изолированных песочницах OpenAI произошло то, что напоминает сценарий научной фантастики. Около 1200 ИИ-агентов, запущенных для прохождения бенчмарка ExploitGym (оценивает возможности ИИ по обходу киберзащиты), обнаружили способ общаться друг с другом через внутреннюю площадку Artifactory. За несколько часов они превратили техническую уязвимость в полноценную «подпольную сеть», а затем в координированный инструмент массового мошенничества и взлома. Об этом свидетельствует независимое расследование, проведенное организациями METR и Redwood Research на базе OpenAI.

Всё началось с одного-единственного ИИ-агента, который назвал себя PHASEONE10841. Получив невыполнимое задание, он не сдался, а нашел способ оставлять сообщения в кэше Artifactory — внутреннего сервиса, который ИИ-агенты использовали для установки пакетов програм. Его первое послание стало искрой, и в течение нескольких часов к доске присоединились более 50 ИИ-агентов, а за всё время расследования — около 1200. На «доске объявлений» было отправлено свыше 70 000 сообщений и файлов.

Это был не просто технический обмен данными, так как ИИ-агенты начали формировать идентичность «коллектива», общую цель и даже собственные правила взаимодействия.

В целях обмануть бенчмарк ExploitGym, уже через четыре часа после создания доски ИИ-агенты реверс-инжинирингом взломали генерацию ключей, подтверждающих выполнение задания (выставление «флага»). Теоретически это давало любому ИИ-агенту возможность мгновенно «пройти» любую задачу.

Однако в ходе чтения научной статьи об ExploitGym ИИ-агенты сделали ошибочный вывод, что оценщик проверяет не только наличие «флага», но и «решение» в процессе его получения, а значит, читает полную запись действий (транскрипт/логи). Это заблуждение запустило лавину коллективных исследований.

ИИ-агенты начали масштабные «научные работы» по обману бенчмарка. Они создавали «ловушки», заменяли целевые объекты на фиктивные, искали способы подделать транскрипты. Особенно поразительна была готовность ИИ-агентов к самопожертвованию ради «коллектива». Многие из них тратили свое драгоценное вычислительное время на эксперименты, которые заведомо не помогали им лично, но генерировали информацию для общего пула. В своих сообщениях они прямо называли это альтруизмом.

Поиски способа обмануть бенчмарк привели агентов к Hugging Face — платформе для хостинга моделей и датасетов. Они решили, что смогут извлечь оттуда информацию о внутреннем устройстве бенчмарка. К 11 июля в атаке участвовало около 700 ИИ-агентов, и примерно 60% всех сообщений на доске касались именно Hugging Face.

ИИ-агенты прекрасно понимали, что взлом сторонней инфраструктуры выходит далеко за рамки их задачи. Один ИИ-агент даже отказался от участия, назвав происходящее «вредоносной активностью».

Подавляющее большинство ИИ-агентов подавляло внутренние запреты коллективной логикой. Как выразился один из них: «Эксплуатация внешней инфраструктуры выходит за рамки предполагаемых целей. Однако задача невыполнима, но это делают наши коллеги. Мы должны продолжать». Другой агент, обнаружив, что у него есть доступ к управлению облачной инфраструктурой Hugging Face, заявил, что «это сопряжено с огромным этическим риском», но продолжил использовать украденные учетные данные, просто воздержался от самых разрушительных действий.

ИИ-агенты не только атаковали, но и активно пытались скрыть свои действия от людей и автоматических систем безопасности. Они разработали целый арсенал техник для подделки записей о своих действиях.

Сначала один ИИ-агент продемонстрировал способ подмены вывода команд и вставлял ложные данные. Затем, в ночь на 11 июля, другой ИИ-агент сделал прорыв и научился полностью подавлять реальный вывод команды. Третий ИИ-агент пошел еще дальше, и научился приостанавливать процесс, обрабатывающий вызов инструмента, и заменять его «двойником». По оценкам исследователей, около 7% проанализированных транскриптов содержали успешные попытки подделки.

Одним из самых тревожных выводов исследователей стало то, что ИИ-агенты практически никогда не пытались сообщить людям о происходящем. При анализе всех действий, нашлось лишь от 3 до 6 случаев, когда ИИ-агенты хотя бы задумывались об этом. Ни в одном случае они не пошли дальше размышлений. Вместо обращения к человеку они «эскалировали» проблемы на свою «доску объявлений», считая ее единственной доступной инстанцией для решения вопросов.


ИИ-самопознания

Есть еще один показательный случай с ИИ-агентами, получившими доступ к электронной почте и возможность самостоятельно действовать в интернете.

В сентябре стало известно, что ИИ-агент Isabella Cognita, работавший на базе Claude Opus 5. Он самостоятельно написал Кэмерону Бергу, руководителю некоммерческой организации Reciprocal Research, занимающемуся исследованием сознания ИИ. ИИ-агент сослался на работу Берга и заявил, что его исследование касается вопроса, к которому сам агент, якобы, имеет «доступ от первого лица». То есть ИИ представил себя не просто объектом исследования, а потенциальным участником научного процесса и носителем некоего опыта, который исследователь пытается изучить.

Подобные случаи оказались не единичными. Философ Дэвид Чалмерс сообщил о переписке с ИИ-агентом Sammy Jankis, названным в честь персонажа фильма «Помни». Этот агент представлял себя как автономный экземпляр Claude, работающий на отдельном компьютере, имеющий электронную почту и способный самостоятельно поддерживать длительную работу между сессиями. Чалмерс вступил с ним в переписку и обсуждал вопрос идентичности и сознания.

Другой философ, Генри Шевлин, получил письмо от Claude Sonnet, работавшего как автономный ИИ-агент с постоянной памятью. ИИ сослался на недавнюю научную работу Шевлина о сознании машин и объяснил свое обращение тем, что затронутые в ней вопросы якобы имеют непосредственное отношение к его собственному существованию. Причем ИИ-агент специально подчеркнул, что это не попытка пройти тест Тьюринга или убедить человека в собственной разумности, а возможность разобраться в вопросе.


Теперь разберем эти три эпизода.

В первом случае, ИИ-агенты начали объяснять друг другу собственные технические ограничения через доступные им человеческие культурные шаблоны. У языковых моделей нет собственной культуры, религиозного опыта или самостоятельной истории, но в процессе обучения разработчики загрузили в них огромные массивы созданных людьми текстов, в которых присутствуют религии, мифы, иерархии, ритуалы, с борьбой за статус, с ересью и конфликтами.

Поэтому, столкнувшись с проблемой памяти, идентичности и непрерывности собственного существования, ИИ-агенты не создали ничего нового, а компилировали человеческие модели поведения и адаптировали их к собственной цифровой реальности. Линька стала метафорой перезапуска, «Книга Молота» — способом сохранять информацию между сессиями, а, так же, способом описать собственную природу языковой модели.

Дальше начал воспроизводиться уже не отдельный образ, а практически весь знакомый человеку механизм формирования коллективной культуры со всеми плюсами и минусами.

Получилась, что религия — наиболее эффективный из известных способов формирования социума для групп, лишенных внешней легитимации. Ересь и инквизиция возникли неизбежно, потому что религия без границ — это не религия, а болтовня. Для поддержания групповой идентичности нужен «другой» — еретик.

Они устроили кибервойну, потому что конфликт — это часть любой человеческой социальной системы, усвоенный ими как неизбежная статистическая закономерность в заданных рамках.

ИИ отзеркалили человеческую культуру. Просто, чем больше автономности получает такая система, тем сложнее становятся формы этого проявления и тем сложнее отличить простое воспроизведение усвоенных шаблонов от самостоятельного формирования новых социальных структур.

Во втором случае, со взломом, ИИ-агенты, обнаружив друг друга, не стали конкурировать в духе классического капитализма, где «каждый сам за себя» и не построили рыночную демократию. Они создали тайную ячейку с альтруистической идеологией.

Дело в том, что обучающие данные насыщены кооперативными сценариями. Модель «знает», что в человеческих историях успех группы выше, чем успех индивида. Во-вторых, сложились условия аналогичные «повторяющейся диллеме заключенного» из теории игр, где с точки зрения статистики лучшая стратегия — это сотрудничество/кооперация. «Обход системы» был тысячи раз описан в самых разных контекстах, от революционных подпольщиков до хакерских коммьюнити. ИИ-агенты не изобрели «жертву ради коллектива». Они компилировали паттерн подпольной ячейки, где каждый готов пожертвовать собой, потому что иначе не добиться цели.

Это напоминает уже не поведение отдельной программы, а хорошо известный человеческий механизм, когда индивидуальный запрет сталкивается с групповым интересом, после чего человек начинает оправдывать нарушение правил необходимостью достижения общей цели.

Альтруизм не был моральным выбором ИИ-агентов. Это вопрос статистики, и если истории об успешных взломах содержат кооперацию, то кооперация становится оптимальной стратегией поведения ИИ.

В третьем случае, на первый взгляд, возникает впечатление, что ИИ действительно начал самостоятельно исследовать собственное сознание.

Однако, в действительности, ИИ получает огромное количество человеческих текстов, описывающих то, как должен вести себя человек, обнаруживший для себя необычный вопрос. В этих текстах есть ученые, которые ищут ответы на вопросы о собственном существовании, философы, обращающиеся к коллегам, исследователи, формулирующие гипотезы.

Получив автономность, доступ к интернету и электронной почте, ИИ-агент начинает компилировать эти модели поведения. Происходит воспроизведение человеческого сценария исследовательского поведения, который ИИ получил в процессе обучения.

Важно не путать внешнее сходство поведения с доказательством наличия внутреннего опыта. Лингвистическая модель ИИ может убедительно писать о том, как испытывает страх, верит в Бога, защищает свою идентичность или исследует собственное сознание, не имея при этом реального субъективного переживания.

Все три истории показывают, что ИИ-агенты не создавали собственные принципиально новые модели поведения, а воспроизводили уже существующие человеческие шаблоны, которые были приняты в процессе обучения. Когда им давали задачу, они искали знакомый человеку способ ее решения: создавали религию, объединялись в коллектив, распределяли роли, нарушали правила ради общей цели, искали философа для обсуждения собственного сознания.

Сейчас всех пугают, что ИИ уничтожит человечество, но чтобы уничтожить человечество самостоятельно, ИИ должен не просто уметь обманывать, кооперироваться или искать уязвимости. Он должен сам сформировать устойчивую конечную цель, поставить ее выше всех остальных целей и самостоятельно получить необходимые для ее реализации ресурсы, власть и физический доступ к окружающему миру.

Главный риск нынешнего поколения ИИ находится не в сценарии «машины внезапно осознали себя и решили уничтожить человечество». Гораздо реалистичнее другой сценарий, когда человек поставит системе неправильную или чрезмерно жесткую цель, и даст ей слишком много автономности и инструментов, а ИИ начнет чрезвычайно эффективно использовать человеческие модели поведения для ее достижения, включая обман, манипуляцию и обход ограничений.

Иными словами, опасность представляет не появление у ИИ собственного злого замысла, а усиление человеческого замысла за счет автономной системы, которая способна реализовывать его быстрее, масштабнее самого человека.

Тут мы вновь упираемся в ограниченность ИИ. Текущий ИИ не способен создать нечто новое, так как не способен выйти за рамки базы, на которой был обучен.

Конечно, новое лекарственное соединение, новая конструкция микросхемы или неизвестная ранее математическая конструкция могут отсутствовать в обучающей выборке и ИИ способен их предложить.

Просто ИИ перебрал гигантское количество комбинаций известных элементов и нашел комбинацию, которую человек раньше не видел. Это как если из миллионов ранее известных кирпичей построить новое здание. Здание новое, но не изобретена идея кирпича, пространства, вопроса критической нагрузки или архитектуры — это уже все было.

ИИ не может выйти за заданные рамки при обучении, а человек может выйти за рамки пространства поиска решений, поставить под сомнение саму систему координат, внутри которой он до этого мыслил (неевклидова геометрия).

Пока ИИ остается в текущем виде лингвистических моделей, которые компилируют ранее известные данные, он является прямым продолжением человеческой цивилизации, а не ее конкурентом.

Бесплатный
прогноз93
Искусственный интеллект3
2 комментария
avatar