Найти в Дзене

Я нанял джуна, и он делает ровно то, что делают джуны 🤪

Сейчас делаю небольшой заказ — систему сбора данных из открытых источников по определённой теме, которая каждое утро выдаёт «Картину дня» по данным прессы и соцсетей «на стол руководителю».
Параллельно решил потестировать разные модели (так как «не Claude-ом единым» же — все вендоры стараются, может что-то и есть нормальное).
Итого хвалёный MiniMax M3 меня (и GPT-5.6) разочаровывает:
— Просишь сделать работу на сервере — делает у себя на ноутбуке.
— Просишь код — присылает план, как он будет писать код.
— Берётся за проверку — проверяет не тот файл.
— Правит три разные вещи и валит их в одну кучу, так что не разобрать, от какой правки стало хуже.
— Заканчивает работу и оставляет за собой мусор.
Узнаёте? У меня джун, естественно, — ИИ-модель. Но ошибки очень похожи на живого сотрудника и даже подрядчика 😊
Чтобы не мучиться самому, ставлю над этим джуном сеньора — модельку подороже и поумнее. Он раздаёт задачи, принимает работу и пишет мне отчёты. Устроено это так: в своей агентной системе HERMES руководителем стоит GPT-5.6 Sol, а исполнителями — субагенты на MiniMax M3.
Сеньор ловит брак до того, как тот уедет в работу. Джун работает на коротких задачах с жёсткими рамками. Но по отчётам сеньора видна вся боль, которую он испытывает 😊 Шесть таких отчётов целиком — в карусели у оригинала: t.me/...778
А кого вы ставили руководителем, кого исполнителем? Какая модель в чём хороша? Где ловили косяки и как исправляли?
Расскажите в чате сообщества — наш бот систематизирует ответы и сделает дайджест о том, какие модели для чего использовать лучше: t.me/...rus
Я нанял джуна, и он делает ровно то, что делают джуны 🤪 Сейчас делаю небольшой заказ — систему сбора данных из открытых источников по определённой теме, которая каждое утро выдаёт «Картину дня» по...
1 минута