Распознавание речи на Python с помощью PyAudio и SpeechRecognition
Распознавание речи в текст онлайн: 8 сервисов и сравнение точности
Распознавание речи в текст, это технология, которая превращает голос в готовый текст: вы диктуете в микрофон или загружаете аудиофайл, а нейросеть выдаёт расшифровку. Разобрали 8 сервисов и сравнили точность на русском: у Yandex SpeechKit ошибок около 4-5%, у Whisper от OpenAI примерно 6-8%, а на чистой записи топ-модели почти сравнялись. Показали, что выбрать для диктовки и для расшифровки файла, где это бесплатно и работает без VPN. Перевести голос в текст сегодня умеют десятки сервисов: от бесплатного блокнота в браузере до корпоративных API за деньги...
Xiaomi выпустила ИИ-модель CocktailASR-1 для распознавания речи в шумных помещениях
Xiaomi представила открытую модель искусственного интеллекта CocktailASR-1. Она предназначена для решения одной из наиболее сложных задач в области расшифровки аудио — выделения голоса конкретного человека в ситуации, когда несколько людей говорят одновременно. В Xiaomi проблему условно обозначили как «эффект коктейльной вечеринки». Большинство специализированных ИИ-моделей справляются с распознаванием речи, когда говорит один человек, но если друг на друга накладываются несколько голосов, ситуация значительно усложняется...