Добавить в корзинуПозвонить
Найти в Дзене
Хегай Новости

Переход на multi-agent-архитектуру незаметно утроил расходы на токены

Команда одного из LLM-приложений заметила резкий рост потребления токенов после того, как часть пайплайна перевели с single-agent на multi-agent-архитектуру. При этом уровень трафика не изменился. Как пишет Towards Data Science, для координации агентов использовали LangGraph, а supervisor node распределял дальнейшие шаги обработки. Сначала разработчики рассчитывали только на умеренный рост затрат из-за большего числа вызовов моделей. На практике расходы выросли примерно втрое, даже для задач, которые по сути остались прежними. Анализ логов показал, что дело не в избыточном fan-out: supervisor вызывал подагентов примерно так, как и ожидалось. Главная причина лишних затрат оказалась связана с повторными вызовами. Ошибки валидации, например malformed tool call, schema mismatch или ответы модели обычным текстом вместо вызова инструмента, запускали агента заново. Система при этом повторно восстанавливала upstream context, а в некоторых сценариях снова вызывала подагентов, уже завершивших ра

Команда одного из LLM-приложений заметила резкий рост потребления токенов после того, как часть пайплайна перевели с single-agent на multi-agent-архитектуру. При этом уровень трафика не изменился. Как пишет Towards Data Science, для координации агентов использовали LangGraph, а supervisor node распределял дальнейшие шаги обработки.

Сначала разработчики рассчитывали только на умеренный рост затрат из-за большего числа вызовов моделей. На практике расходы выросли примерно втрое, даже для задач, которые по сути остались прежними. Анализ логов показал, что дело не в избыточном fan-out: supervisor вызывал подагентов примерно так, как и ожидалось.

Главная причина лишних затрат оказалась связана с повторными вызовами. Ошибки валидации, например malformed tool call, schema mismatch или ответы модели обычным текстом вместо вызова инструмента, запускали агента заново. Система при этом повторно восстанавливала upstream context, а в некоторых сценариях снова вызывала подагентов, уже завершивших работу. Из-за этого даже единичный сбой внутри графа мог привести к каскаду повторных вычислений и дополнительному расходу токенов.

Читать на сайте hegai.media →