5 дней назад
Словарь против семантики: почему списки ключевых слов ломают классификацию в LLM-боте. Часть 4
Четвёртая часть серии про инженерию Telegram-бота с характером. В первой части я пообещал отдельный разбор того, почему лексические триггеры проигрывают семантическим. Долг возвращаю — вместе с неприятной поправкой: «проигрывают» оказалось неточной формулировкой. Словарь и модель ошибаются по-разному, и выбирать между ними по признаку «что умнее» — самый быстрый способ получить обе ошибки сразу. Речь о «Джонни» — язвительном инженерном персонаже в Telegram, который начинался как развлечение на вечер и дорос до системы с маршрутизацией, границами контекста и регрессионными проверками...