Дайте нейросети стартап, и она обанкротит его за месяц 📉

Агенты уже умеют закрывать тикеты и править локальные баги в коде, но это — задачи с коротким горизонтом. Сделал действие -> сразу получил фидбек. В реальном бизнесе так не работает. Решения имеют отложенные последствия, информация зашумлена, а правила игры меняются на лету.

Исследователи из Принстона выкатили интересный бенчмарк для ИИ-агентов — CEO-Bench. Агенту дают 1 млн долларов стартового капитала, фиктивный AI-стартап и 500 дней на то, чтобы не сдохнуть.


Как работает мясорубка CEO-Bench 💼

Инструментарий: 34 метода через Python API, 19 SQL-таблиц (база юзеров, биллинг, саппорт), симуляция соцсетей, конкурентов и макроэкономики.

Среда симулирует то, от чего седеют реальные фаундеры и техлиды. У агента есть Python-интерфейс (novamind_api) с 34 метода через Python API, 19 SQL-таблиц (база юзеров, биллинг, саппорт), симуляция соцсетей, конкурентов и макроэкономики.

Что нужно делать:

🟢 Управлять ценами, квотами и R&D.

🟢 Распределять бюджет на таргет и инфраструктуру.

🟢 Закрывать enterprise-сделки (с многоходовыми торгами).

🟢 Разгребать нытье недовольных клиентов в соцсетях.

Главная фишка симуляции — отложенные последствия и скрытые переменные.

Агент не видит лояльность клиентов в виде цифры. Он должен выводить ее из косвенных метрик: оттока, тикетов в саппорт и постов в соцсетях. Закинул деньги в R&D сегодня? Результат будет непредсказуемым и через месяц. Сэкономил на серверах? Завтра ляжет прод, послезавтра enterprise-клиенты уйдут к конкурентам, а репутация на рынке пробьет дно.


Результаты: парад банкротств 💳

Давайте посмотрим на цифры из отчета. Разработчики протестировали зоопарк топовых моделей (включая Claude Fable 5, GPT-5.6 Sol и Qwen 3.7 Max).

Был написан простейший rule-based бейзлайн. Обычный скрипт на жестких правилах, который тупо льет фиксированный бюджет в R&D и таргет, опираясь на текущую нагрузку, и вообще не трогает цены. Этот кусок кода заработал $15.7M.

А теперь посмотрим на «интеллект» моделей:

🟠 Claude Fable 5 — $12.6M. Лучший из LLM, но все равно проиграл тупому скрипту.

🟠 GPT-5.6 Sol — $11.3M в лучшем прогоне, но в двух других из трех тупо обанкротился к 190 дню.

🟠 Claude Opus 4.8 — выжал $2.4M.

🟠 GPT-5.5 — $33k. Модель смогла раздуть базу юзеров, увидела кэш, решила порезать косты на инфраструктуру и качество, словила массовый отвал клиентов на продлении подписок и сожгла все деньги. Классический эффективный менеджмент 🌚

🟠 DeepSeek V4 Pro, Gemini 3 Flash, Grok 4.20 — не выжили ни в одном из прогонов. Твердый ноль на счету.

Дайте нейросети стартап, и она обанкротит его за месяц 📉


Почему LLM не умеют в стратегию? 😱

Анализ логов показывает: у моделей пока в зачаточном состоянии Steering Intelligence (навык управления системой во времени).

1️⃣ Игнорирование отложенных последствий. GPT-5.5 видит, что юзеры платят, и решает: «А давайте урежем квоты и сервера, чтобы поднять маржу!». Через месяц метрики качества падают, начинается шквал тикетов в саппорт, клиенты не продлевают контракты, стартап — труп. Агент просто не связывает свои действия в прошлом с катастрофой в настоящем.

2️⃣ Неумение парсить косвенные сигналы. В бенче нет таблички «истинная готовность платить». Есть гневные посты в соцсетях, графики оттока и история переговоров. Большинство моделей не понимают, что с этим делать, если им не разжевать проблему в промпте.

3️⃣ Отсутствие фокуса. Слабые модели рандомно дергают ручки: сегодня влили $100k в маркетинг, завтра поменяли цены, послезавтра закрыли R&D. Только топовые агенты (вроде Fable 5) догадываются писать собственные скрипты прямо внутри среды, чтобы симулировать отток когорт и прогнозировать кэш-флоу.


В общем, сложные такси из реальной жизни доверять моделькам рано. Да и многим людям тоже не стоит 🤣

Бесплатный
Комментарии
avatar
Здесь будут комментарии к публикации