Практика ИИ
Одна модель, разные агенты: как сравнивать цену выполненной задачи
The Decoder пересказывает тест Composio, в котором одну модель запускали через разные агентные оболочки. Результаты различались по скорости, стоимости и успешности. Для бизнеса это повод сравнивать весь рабочий процесс, а не только тариф выбранной модели.
Коротко
- Тест Composio описан вторичным источником и независимо не повторён.
- Самый быстрый вариант в этом тесте не оказался самым дешёвым.
- Предлагаем оценивать готовый рабочий пакет вместе с ошибками и исправлениями.

Что сравнивали в публикации
В материале от 6 августа 2026 года The Decoder описывает тест компании Composio. Одну модель DeepSeek V4 Flash запускали через Claude Code, Codex, OpenCode и Oh My Pi на тридцати задачах с рабочими инструментами, включая Gmail, GitHub, Slack и Notion.
Согласно пересказу, ни одна оболочка не победила по всем показателям. Claude Code оказался самым быстрым, OpenCode — самым дешёвым по успешной задаче, а Oh My Pi показал наибольшее число успешных завершений, но затратил больше времени. Это результаты конкретного набора заданий.
Издание отмечает, что Claude Code оставался самым дорогим вариантом, хотя делал меньше обращений к инструментам и генерировал меньше выходных токенов. Одного счётчика действий поэтому недостаточно для объяснения итоговой цены. Воспроизвести расчёт без исходных условий мы не можем.
Размер набора и различие задач ограничивают выводы. Такой эксперимент не устанавливает лучший инструмент для любой компании и не доказывает, что соотношение цен сохранится после обновления программ. Он показывает, почему оболочку вокруг модели следует включать в сравнение.
Определить, что считается выполнением
Предлагаем собственный тест для рекламной команды: подготовить пакет к согласованию по исходному брифу, каталогу и правилам бренда. Результат должен содержать готовые материалы и основания для спорных утверждений. Красивое сообщение агента о завершении работы не заменяет этот пакет.
Критерии приёмки задают до первого запуска. Например, цены совпадают с каталогом, обязательные ограничения акции сохранены, ссылки ведут на нужные страницы, а неподтверждённые обещания помечены. Проверяющий оценивает результат по этим условиям, не по убедительности объяснений помощника.
Если агент создал файлы не там, потерял один формат или оставил незаполненное поле, задача остаётся незавершённой. Иначе быстрый вариант получит преимущество просто потому, что сделал меньше требуемого. Частичную готовность можно учитывать отдельно, но нельзя смешивать с успешным завершением.
Учитывать все попытки
В стоимость включают неудачные прогоны, повторы после ошибки и ручное восстановление контекста. Оплата только удачного запуска скрывает цену поиска решения. Команда должна заранее решить, сколько попыток допускается и кто вправе запустить следующую.
Время сотрудника записывают отдельно от ожидания машины. Долгий автономный прогон может меньше отвлекать редактора, чем короткая серия запусков с постоянными уточнениями. Для разных отделов эти затраты имеют разное значение, поэтому сводить их к скорости ответа нельзя.
Также проверяют внешние последствия. Агент, который отправил тестовый текст клиенту вместо сохранения черновика, не проходит испытание, даже если содержание верно. Во время сравнения используют учебные аккаунты и ограниченные права, исключающие такую отправку в рабочую среду.
Сравнение, которое можно повторить
Обеим оболочкам дают одинаковые исходные файлы и доступные инструменты. Фиксируют версии модели и программ, настройки, критерии остановки и момент измерения затрат. Если одному исполнителю помог сотрудник, это вмешательство отражают в журнале, а не считают автоматическим успехом.
Полезно включить задания с недостающими данными. Правильным результатом тогда может быть запрос уточнения или остановка с объяснением, а не выдуманный рекламный тезис. Так проверяют способность помощника соблюдать границы задания, а не только производить документы.
После теста выбирают инструмент под конкретный режим работы. Для срочного черновика важнее задержка, для ночной подготовки большого пакета — стоимость и доля пригодных результатов. Решение опирается на собственные измерения, а опубликованный тест остаётся поводом проверить эти различия, не готовой рекомендацией к покупке.
Источники и границы разбора
- The DecoderClaude Code is the fastest agent framework but costs nearly three times more than the cheapest rival
Прочитан открытый материал The Decoder о тесте Composio. Исходный эксперимент и расчёты независимо не проверены. Сценарий сравнения рекламных помощников предложен редакцией; результаты теста на него не переносятся.
Прочитан открытый материал The Decoder о тесте Composio. Исходный эксперимент и расчёты независимо не проверены. Сценарий сравнения рекламных помощников предложен редакцией; результаты теста на него не переносятся.
Сравнить агентные инструменты на вашей задаче
Подготовим критерии завершения, безопасный тестовый набор и учёт расходов на попытки, исправления и ручную проверку.
Обсудить задачу