Команда одного из LLM-приложений заметила резкий рост потребления токенов после того, как часть пайплайна перевели с single-agent на multi-agent-архитектуру. При этом уровень трафика не изменился. Как пишет Towards Data Science, для координации агентов использовали LangGraph, а supervisor node распределял дальнейшие шаги обработки. Сначала разработчики рассчитывали только на умеренный рост затрат из-за большего числа вызовов моделей. На практике расходы выросли примерно втрое, даже для задач, которые по сути остались прежними. Анализ логов показал, что дело не в избыточном fan-out: supervisor вызывал подагентов примерно так, как и ожидалось. Главная причина лишних затрат оказалась связана с повторными вызовами. Ошибки валидации, например malformed tool call, schema mismatch или ответы модели обычным текстом вместо вызова инструмента, запускали агента заново. Система при этом повторно восстанавливала upstream context, а в некоторых сценариях снова вызывала подагентов, уже завершивших ра