Ввод и редактирование формул.Excel для начинающих пользователей.
Как индустрия меряет ИИ сломанной линейкой
📐 Каждый релиз новой LLM сопровождается цветастыми графиками, где столбик с надписью SWE-bench упирается в небеса. Маркетологи визжат: «Модель автономно решает 80% задач разработки, программистам приготовиться!». А теперь следите за руками. Уже давненько OpenAI выпустили разбор, где фактически хоронят бенчмарк SWE-bench Verified. Основные причины две: 1️⃣ Контаминация (утечка данных). Задачи для бенчмарка парсили из закрытых issue и pull requests открытых репозиториев на GitHub. Очевидно, что эти же репозитории разработчики пылесосили при обучении своих моделей...