ElevenLabs представила модель v4 с улучшенным контролем экспрессии и поддержкой 90 языков
Новая v4‑модель способна клонировать голос по десятисекундному аудиофрагменту и обеспечивает более тонкую настройку эмоционального выражения.

Компания ElevenLabs анонсировала выпуск своей модели синтеза речи v4, которая охватывает девяносто языков и предлагает более гибкие инструменты для контроля экспрессии.
В отличие от предшественников, v4 способна создать реалистичную копию голоса, используя лишь десятисекундную запись, что значительно упрощает процесс создания персонализированных голосов.
Расширенные параметры контроля позволяют разработчикам регулировать высоту тона, тембр и эмоциональные нюансы в реальном времени, делая синтезированную речь пригодной для виртуальных ассистентов, аудиокниг и интерактивных систем.
Для технологического сектора Узбекистана доступ к высококачественной синтетической речи на узбекском и других региональных языках создаёт перспективы для разработки образовательных платформ, медиаконтента и решений для людей с ограниченными возможностями.
По сравнению с версией v3, модель v4 демонстрирует улучшенную звуковую точность и сниженную задержку, устраняя два основных недостатка предыдущих систем синтеза речи.
Эксперты отмечают, что такой шаг приближает индустрию к созданию действительно естественных и многоязычных ИИ‑голосов, пригодных для широкого спектра потребительских и корпоративных продуктов.



