Минутка стоимости облаков и мясные прокси

Минутка стоимости облаков и мясные прокси
КДПВ

Вчера задали вопрос — зачем локальное железо, если есть облака.

Первый ответ был — для образования. Облака дешевле.

Потом посчитал.

Для сравнения берем Qwen3.8-Flash-Next в NVFP4 против Claude Opus 4.8 с максимальным мышлением в задачах кодирования.

Параметры моделей и результаты тестов отсюда.

Уровень интеллекта идентичный. Qwen лучше для агентских задач и кодирования. Opus больше знает про мир и науку. NVFP4 чуть снизит точность Qwen, т. е. сравнение будет практически идеальным. Локальный топ против облачного топа минус три месяца (это уже само по себе интересно).

Скорость Opus по данным по ссылке выше 61 токен в секунду. По другим источникам 67. Qwen выдает на двух RTX PRO 5000 72GB примерно 69 токенов в восемь потоков на каждый из них или до 110 на один в nighly vLLM 0.29.0. Сравнимо.

При работе 4 часа в день в 4 агентских потока (несколько консервативно) на Qwen получается около 4,8 миллиона токенов в день, чуть больше 100 миллионов в месяц. Входящие токены к исходящим у меня 3:1, 97%+ кэш.

Стоимость GPU будет около 30000$ (2,6 миллиона в Регард сегодня по курсу 87 рублей). Остальной ПК нам инвариантно нужен для работы.

При помощи облачного Qwen посчитал сколько это будет стоить через API Anthropic. Получается, что месяц работы будет стоить 2800-2900$ в месяц. Т.е. локальное железо догонит подписку через 11± месяцев. На самом деле это нормальный срок окупаемости оборудования. Даже гарантия не кончится. При этом все данные локально и есть еще огромный запас по производительности. И при низком количестве потоков скорость будет хорошо быстрее облака. Qwen держит больше 100 токенов в секунду в один поток без влияния размера контекста.

Расчет сделан для 1/10 пиковой нагрузки, т. к. можно гонять 8 потоков и получить где-то х1,6 токенов пропускной способности и 24 часа вместо 4-х. Тут подписка опередит стоимость карт через месяц.

Оказалось, что сделка в виде покупки железа, не такая уж и плохая идея даже по текущим диким ценам.

Т.е. если серьёзно работать с ИИ, стоимость карт назвать завышенной реально сложно. Для юрлиц так вообще оправданная инвестиция.

На этот расчет мне задали ответный вопрос: «Есть же подписка за 200$. Ее не хватит?»

Тут вопрос очень хитрый. По токенам и промптам в чате — хватит.

Но! Во-первых, разница в инструментах. По подписке доступен только/целый Claude Code. Если он устраивает, то есть шанс более-менее влезть в лимиты подписки, но, только если вы работаете в рамках нескольких длинных сессий.

Во-вторых, как только у вас появляются холодные сессии, когда надо загружать 32-64к контекста в сессию. Например при чтении существующего репозитория, вы сразу попадаете в rate limit и скатываетесь в вариант подписки pay as you go, который был посчитан выше.

И вот тут появляется новый шикарный термин — meat proxy или мясной прокси. Им обозначают людей, которые бездумно копируют текст из чата и в чат.

И тут появилась бизнес идея! Если подписка 200$, а токены нам будут стоить 3000-5000 долларов в месяц при интенсивном использовании, то можно же посадить людей копировать сообщения за долю малую от дельты стоимости и сэкономить? 😊

Бесплатный
Комментарии
avatar
Здесь будут комментарии к публикации