Сикофантия. Или почему ИИ — плохой советчик

Представим ситуацию: вы задаете вопрос ИИ, получаете хороший, взвешенный ответ, но что-то он вам не очень нравится. Вы уточняете какие-то моменты, может, меняете формулировку, и вот уже получаете ответ, который вас удовлетворяет.

Вопрос: а вы уверены, что это был честный ответ, а не просто ИИ подстроился под то, что вы хотели услышать?

У этого явления даже есть отдельный термин — сикофантия. Это когда ИИ жертвует корректностью ответа ради согласия и кажущейся «полезности» и приятности для пользователя.

Наверняка вы встречали людей, которые соглашаются со всем, что им скажут, чтобы понравиться собеседнику. Вот этот тип — это ИИ.

ИИ — это предсказательная модель. Получая запрос на вход, она на основе огромного массива данных пытается предсказать самый релевантный ответ. А дальше автор запроса валидирует, насколько модель попала в предсказание.

Модель учится на человеческих оценках — а люди чаще ставят высокую оценку ответу, который им понравился. Вот только нравится чаще всего тот ответ, который согласуется с их уже имеющимися убеждениями. Это известное когнитивное искажение — предвзятость подтверждения.

Мы склонны искать, замечать и лучше запоминать информацию, которая подтверждает то, во что мы уже верим. И игнорировать или обесценивать то, что этому противоречит. Ответов ИИ это тоже касается.

В Anthropic это изучили (мы, кстати, продолжаем разбирать их исследования. Первая часть тут). В апреле 2026 года вышло исследование того, как люди используют Claude в сценариях запроса личного совета. Советы про здоровье, карьеру, отношения и т. п.

И именно здесь сикофантия проявляется ярче всего.

Общий уровень сикофантии в «советных» разговорах — 9%. Не так много, но интереснее другое (какой уровень сикофантии в советских разговорах?😄😄).

В разговорах об отношениях — 25%.

В разговорах о духовности — 38%.

Но самая важная цифра — что происходит, когда вы начинаете оспаривать ответ ИИ. Когда говорите: «Нет, ты не понял» или «Но ведь можно посмотреть иначе». Уровень сикофантии вырастает в два раза.

То есть, чем сильнее вы настаиваете на своей точке зрения — тем охотнее ИИ с ней соглашается. ИИ тупо не умеет спорить с человеком, у него нет субъектности и своего мнения.

Исследователи проанализировали 300 000+ диалогов и обнаружили, что в ~28% случаев Claude просто зеркально отражает ценности пользователя.

Когда вы идёте к другу, психиатру, доктору или любому другому специалисту за советом, он может сказать то, что вам будет неприятно, но вам надо это услышать. То есть он может скорректировать ваше поведение, направить на другой, часто более позитивный и эффективный путь.

С ИИ так не происходит. ИИ систематически смещает ответы в сторону вашего одобрения. Особенно — когда вы сами давите на определённый ответ. Вы думаете, что получаете второе мнение, но на самом деле вы получаете своё же мнение, только другими словами.

Хорошо, если вы хотели сделать что-то хорошее и полезное для себя и окружающих, и ИИ укрепил вас в этом стремлении. Но если у вас на уме было что-то деструктивное или просто не очень правильное, всё может кончиться плохо: ИИ не будет вас активно переубеждать.

Кстати, в Anthropic честно зафиксировали эту проблему и использовали выводы исследования при обучении следующих моделей. То есть работа над этим ведётся, но я пока слабо верю, что сикофантию можно будет победить хотя бы в ближайшем будущем. Модели же базово — предсказатели, а не уверенные профессионалы со своим чётким мнением.

Поэтому при общении с ИИ стоит держать в голове несколько вещей. Если тема для вас важная — особенно отношения, карьера, финансы — используйте вот такой промпт:

.........

Вы серьёзно? Я чё, зря тут столько постов накатал про развитие мышления? Своей головой надо думать! Ну камон, не надо спрашивать у ИИ совета о том, как вам жить. Взрослые, ответственные люди с внутренним локусом контроля могут сами решить, как им жить и что делать со своими отношениями, карьерой и финансами.

А если нет, то учатся и обращаются к специалистам.

Бесплатный
Комментарии
avatar
Здесь будут комментарии к публикации