Аудио-Реклама•ru
Open-source TTS догоняет ElevenLabs по качеству
На этой неделе вышло три проекта, которые меняют баланс в голосовом рынке: StyleTTS2 (open-source), Voice-Pro (YC W25, self-improving), и Speko (YC S26, OpenRouter для Voice AI). StyleTTS2 — открытая модель синтеза речи, которая по качеству приближается к коммерческим решениям ElevenLabs. Voice-Pro — стартап из Y Combinator, который делает self-improving TTS: модель улучшает себя сама на основе обратной связи. Speko — «OpenRouter для Voice AI», платформа, которая объединяет голосовые модели в единую точку доступа...
Актёры требуют регулирования AI-клонирования голосов
Голливудские актёры вышли с требованием к регуляторам: клонирование голоса через ИИ должно быть ограничено законом. Не «запретить технологии», а установить правила, при которых копия голоса создаётся только с согласия носителя и под его контролем. Это не первый сигнал. SAG-AFTRA ratified 78.33% за регулирование цифровых копий в 2023 году. Калифорния приняла AB 1836 и AB 2602 в 2024-м. EU AI Act закрепил рамку на уровне ЕС. Но теперь требование идёт не от юристов и не от регуляторов — его выдвигают сами носители голоса...
Два года назад Калифорния сделала голос объектом согласия
17 сентября 2024 года в Калифорнии вступили в силу AB 1836 и AB 2602. С этого дня голос и цифровое подобие стали объектами, для использования которых требуется согласие носителя. Не «защита данных», не «авторское право на запись». Отдельный правовой слой: голос — это не информация о человеке, а сам человек, и распоряжаться им можно только с его ведома. SAG-AFTRA ratified 78.33% за регулирование цифровых копий голоса в 2023 году...
Голос стал пультом: ИИ выполняет команды голосом
Два события подтвердили: голос перестал быть только атрибутом контента — он стал интерфейсом управления. В июле OpenAI заменила Advanced Voice Mode на GPT-Live: голос стал способом управлять ПО для ~150 млн платящих пользователей. В сентябре GPT-6 Astra выполняет компьютерную работу голосом: OSWorld 2.0 — 72,6%, BenchCAD — 95,9%. Не «голос звучит красиво», а «голос делает работу». Команда голосом — оформить, перевести, отправить — превращается из демо в рабочий инструмент...
61% слушателей не отличают синтетический голос от живого — и это измеримо
Edison Research провёл крупнейшее исследование слепого теста: 1000+ потребителей аудиокниг, май 2026 года. Результат: 61% слушателей не смогли отличить синтетический голос от живого диктора. Не «почти все». Не «большинство». Конкретная цифра из конкретной выборки, и она означает одно: человеческое ухо больше не является надёжным детектором. Голос, который звучит «как живой», теперь может быть синтезом. Но вторая цифра важнее...
