". Формально правда. Фактически - четыре места в четырёх разных купе и двух вагонах. Семья едет шесть суток по разным дверям. Модель не соврала. Ей просто никто не объяснил разницу между "четыре свободных места" и "четыре места за одной дверью". В ответе API РЖД такого поля нет, разницу надо вычислять: календарь → поезда → вагоны → схема вагона → номера мест, сгруппированные по купе. Пять шагов, и только на пятом понятно, что показывать человеку. Я вынес эти шаги в MCP-инструменты, чтобы проверка жила в коде, а не в голове модели...
Iconicompany.com IT-HUB
ИИ забрал у вас рутину - и теперь вы вайбкодите по 16 часов в день
Промпт на каждую задачу, глаз да глаз. Это не автоматизация - вы стали диспетчером у модели. Если так, вы уже опоздали: пока вы правите за агентом каждую строчку, узкое место давно не код. Сегодня я собрал цепочку, где человек кода не пишет. На входе - требования, BRD/FR. Дальше сами собой: use cases с проверяемыми критериями, глоссарий, модель данных, схема БД, API. Каждый шаг - читаемый аналитиком markdown, следующий выводится из предыдущего. Схема Drizzle, миграция в живой Postgres, OpenAPI и типизированный клиент выпадают из спеки сами...
Арендовал 3090, чтобы отсеивать плохих кандидатов до дорогого LLM-этапа
Проиграл скрипту, который считает на процессоре за копейки. Проблема была видна в цифрах: косинусный поиск нагоняет по 391 кандидату на вакансию, и почти половина того, что доходит до LLM, - мусор. Тысячи холостых прогонов самого дорогого этапа в конвейере. Логично было взять сильный реранкер и резать мусор им. Я прогнал bge-reranker-v2-m3 и mmarco на полном тексте "вакансия x резюме". Оба еле отличали мусор от годных - почти как монетка. Дообучение CrossEncoder вообще не сошлось: у нас есть данные про тех, кто подошёл, но нет размеченных "не подошёл", и модель училась на противоречиях. А выиграло самое скучное - пересечение навыков...
AI-агент берёт задачу и уходит на 52 шага и 36 тысяч токенов
Часто уже в начале видно, что не решится - но узнаёте вы об этом в конце, когда бюджет сожжён. Свежая работа (Silva, Tu, Monperrus) показывает: сама модель понимает это раньше. Простой классификатор поверх её скрытых состояний угадывает, заработает ли код (AUC до 0,83), ещё до того, как код дописан. И частично предсказывает будущее - направление на ~25 шагов вперёд. Причём сигнал сильнее не в последнем слое, а в середине сети. Нам это знакомо с другой стороны:...
На бумаге AI-native инженер и тот, кто просто выучил слово "ai-native", выглядят одинаково
Оба пишут Cursor, "MVP за 2 недели" и пять лет нужного стека. Разница не в резюме, а в артефактах. Резюме - это заявленное, код - сделанное. "5 лет SQL" при нуле схем и миграций за эти годы - не эксперт, а правки строк в готовых запросах. Поэтому мы не верим полям резюме. Вытаскиваем реальные концепты прямо из репозитория - какие библиотеки, версии БД, инфраструктура, а не абстрактный "бэкенд". Считаем вероятность fit-а по смыслу, а не по ключевым словам...
