Метод Сократа – До и после: в поисках истины
Алгоритм без ИИ не уступает специализированным моделям отбора кадров в видео
Учёные провели контролируемое исследование того, как мультимодальные языковые модели (MLLM) работают с длинными видео. Проблема в том, что модель не может просмотреть каждый кадр: час видео с частотой одного кадра в секунду даёт 3600 изображений, а система хранит и анализирует лишь небольшую фиксированную часть этого пула. Обычно то, какие именно кадры отбираются, считается технической деталью препроцессинга; авторы проверили, действительно ли это второстепенный вопрос. Раньше сравнивать опубликованные...