18 подписчиков

Сбер выпустил приложение для работы с речевыми технологиями для Windows и macOS

16 ноября 202316 ноя 2023

2 мин

Команда Сбербанка сообщила о выпуске отдельного приложения для работы с речевыми технологиями — SaluteSpeech App. Как отмечает пресс-служба, это новый удобный инструмент для распознавания аудио и озвучивания текста.

Приложение доступно для операционных систем Windows и macOS, отличается простотой использования и включает в себя возможности GigaChat API, программного интерфейса доступа к сервису GigaChat.

В SaluteSpeech App два раздела, каждый из которых соответствует своей технологии. Раздел «Распознавание» предназначен для текстовой расшифровки встреч, звонков, интервью и любых других голосовых файлов. Раздел «Синтез», наоборот, позволяет озвучить текст, настраивая паузы и ударения, и даёт возможность скачать готовый аудиофайл на своё устройство. Синтезировать текст можно разными голосами из семи общедоступных вариантов на русском и английском языках.

Использование GigaChat API дополнительно упрощает процесс подготовки аудиоконтента. Пользователь может загрузить короткие тезисы и попросить нейросетевую модель на их базе подготовить необходимый текст для последующего синтеза. Например, написать сказку по заданной теме, затем озвучить ее, чтобы полученный аудиофайл включать ребенку в машине или перед сном. Также с помощью GigaChat API в приложении SaluteSpeech App можно сделать короткую выжимку протокола встречи, аналитического отчёта или любого другого текста, а затем озвучить полученный материал. Есть множество и других кейсов, всё зависит от задач и фантазии пользователя.

Подключив сервис SaluteSpeech и вы сможете:

Синтезировать и распознавать речь в приложении для Windows и MacOS.
Интегрировать технологию SaluteSpeech в свои приложения по API HTTP или gRPC.
Озвучивать текст разными голосами.
Использовать SSML-разметку для улучшения синтеза.
При распознавании речи анализировать удовлетворенность клиентов с помощью Insights моделей.
Разделять спикеров при распознавании одновременной речи.

Есть несколько способов воспользоваться технологией SaluteSpeech:

Попробуйте сервис на портале сбера. Выберите голос, введите текст в поле, нажмите Синтезировать и получите аудио.
Скачайте приложение для Windows или MacOS и озвучивайте тексты без навыков программирования. Подробнее — в разделе Пользовательский интерфейс.
Используйте API. Если у вас есть навыки разработчика, вам доступна полная функциональность сервиса: синхронный и асинхронный синтез по протоколам HTTP и gRPC.
Скопируйте шаблоны Postman. Они помогут, если вы не готовы самостоятельно работать с API. Подробнее читайте в пошаговой инструкции Синтез речи с Postman.

Как обещают в Сбере, приложение будет доступно всем желающим без оплаты и подойдёт для решения самых разных задач.