2 недели назад
Анализ тональности речи через дистилляцию знаний и кросс-модальную интеграцию сгенерированных многоязычных транскриптов
Определение тональности речи, распознавание того, звучит ли высказывание позитивно или негативно, сложная задача: система должна одновременно анализировать интонацию голоса и понимать смысл произнесённых слов. По словам авторов, современные решения обычно полагаются на крупные базовые аудиомодели (audio foundation models), но остаётся неясным, учитывают ли такие модели оба аспекта сразу, и звучание, и содержание речи. Чтобы решить эту проблему, авторы предлагают мультимодальный подход: аудио- и текстовая информация объединяются с помощью кросс-модальных трансформеров...