Přejít k hlavnímu obsahu

Poznáte ještě člověka? Eleven v4 zvládá emoce a reaguje za 150 ms

Ilustrační obrázek pro jarvis-ai.cz

Generování lidského hlasu pomocí umělé inteligence dlouho naráželo na dvě překážky: buď byl projev emotivní, ale pomalý, nebo rychlý, leč strojově plochý. Společnost ElevenLabs nyní vydala novou generaci modelů Eleven v4 a Eleven v4 Turbo, která tuto bariéru maže. Ve slepých testech posluchačů poráží dosavadní špičku trhu a zkracuje reakční dobu na úroveň lidské konverzační pauzy.

Shrnutí v bodech

  • Vítězství ve slepých testech: Přibližně 75 % posluchačů dalo v přímém srovnání přednost modelu Eleven v4 před konkurenčními řešeními Cartesia Sonic 3.6 či Gemini 3.8 Flash TTS.
  • Řízení intonace v textu: Model nově reaguje na textové režijní pokyny a zvukové značky přímo v zadání, jako je smích, šepot nebo specifický přízvuk.
  • Rychlost pro agenty: Odlehčená varianta Eleven v4 Turbo začíná mluvit za 150 milisekund, což umožňuje nasazení v živých telefonních a zákaznických linkách.
  • Bleskový klon: K vytvoření věrné hlasové kopie nově stačí nahrávka o délce pouhých 10 sekund.

Skok v přirozenosti: Konec plochého předčítání

Jedna a tatáž věta může mít v reálném světě zcela odlišný význam podle toho, jakým tónem ji člověk pronese. Věta „Potřebuji, abyste zůstali v klidu" zní jinak z úst lékaře uklidňujícího pacienta a jinak od velitele jednotky v akční videohře. Právě na tuto dynamiku se vývojáři v ElevenLabs zaměřili při stavbě nové architektury.

Zatímco předchozí generace syntézy řeči obvykle zpracovávaly text větu po větě bez hlubšího povědomí o celku, Eleven v4 interpretuje kontext celé scény. Při rozhovoru více mluvčích model navazuje na náladu a tempo předchozí repliky. Pokud jedna postava zvýší hlas nebo znejistí, druhá strana na změnu intonace přirozeně odpoví, místo aby působila jako nezávislý automat čtoucí izolovaný řádek.

Skok v kvalitě okamžitě vyvolal silnou odezvu mezi tvůrci i vývojáři. Francouzský technologický komentátor vystupující pod přezdívkou Futur Lucide po poslechu prvních ukázek na síti X uvedl: „Právě jsem doposlouchal Eleven v4 a myslím, že tady je konec. Jsem ohromen tím, co vydali. Dostáváme se na úroveň, kdy se u některých ukázek musím opravdu soustředit, abych si uvědomil, že hlas, který poslouchám, není lidský."

Ovládání emocí přímo v textu i přesná fonetika

Praktickou novinkou pro autory audioknih, herní vývojáře i dabingová studia je možnost přesného směrování hlasu přirozeným jazykem. Do textu lze nově vkládat inline značky, které modelu určují chování i doprovodné zvuky. Zápisy jako [laughs], [whispering], [said angrily in French accent] nebo [phone buzzing] model spolehlivě promítne do výsledného audia bez nutnosti složité postprodukce.

Výrazného zlepšení se dočkala také podpora mezinárodní fonetické abecedy (IPA). U odborných technických názvů, lékařských termínů nebo cizojazyčných vlastních jmen tak lze fonetickým zápisem přesně vynutit správnou výslovnost, což u dřívějších verzí bývalo zdrojem častých chyb.

Dominance v nezávislých žebříčcích

Slova autorů o posunu potvrzují i nezávislá srovnání. Podle údajů na žebříčku Artificial Analysis obsadil Eleven v4 první příčku v hodnocení kvality syntézy hlasu (Provider Voice Arena Elo). V metodických slepých poslechových testech, kde hodnotitelé posuzovali přirozenost a expresivitu projevu bez znalosti původu modelu, zvítězil Eleven v4 v přibližně 75 % případů proti rivalům Cartesia Sonic 3.6, Inworld TTS-2 i hlasovým modelům rodiny Google Gemini 3.8 Flash.

Kromě samotné barvy zvuku testy vyhodnocovaly schopnost udržet identitu mluvčího v delších pasážích. Eleven v4 netrpí postupnou ztrátou charakteru hlasu ani při generování rozsáhlých kapitol či opakovaných úpravách vybraných odstavců.

Eleven v4 Turbo: Hlasoví agenti bez nepříjemného ticha

Vedle plnohodnotného modelu představila společnost také variantu Eleven v4 Turbo, určenou pro aplikace vyžadující okamžitou odezvu. V interaktivních hlasových botech a telefonních asistentech znamenala dosud každá vteřina prodlevy nepřirozenou pauzu, kvůli které firmy často volily sice rychlé, ale roboticky znějící systémy.

Verze Turbo dosahuje mediánu latence do zahájení přehrávání zvuku (time to first speech) okolo 150 milisekund při streamování přes WebSocket. Samotný výpočet inference se pohybuje okolo 100 milisekund. To je hodnota kratší než běžná prodleva mezi dvěma lidmi v živém dialogu. Vývojáři tak mohou stavět zákaznické asistenty, kteří znějí lidsky, netrpí mechanickým tónem a zároveň reagují bez znatelného čekání.

Devadesát jazyků a klonování z deseti sekund

Oba modely podporují více než 90 světových jazyků. Znatelnou proměnou prošla vícejazyčná stabilita: hlas původně nahraný v jednom jazyce dokáže plynně promlouvat v jiném, přičemž přebírá přirozený přízvuk cílového jazyka, aniž by ztrácel barvu původního mluvčího. Model už netrpí neduhem, kdy se hlas v průběhu delšího projevu postupně vracel k mateřskému akcentu.

V oblasti klonování hlasu (Instant Voice Clone) posunula nová architektura potřebný objem trénovacích dat na minimum. K vytvoření použitelného digitálního dvojčete stačí 10 sekund čistého zvukového záznamu. Pro nejnáročnější komerční projekty zůstává k dispozici režim profesionálního klonování (Professional Voice Clone), který zaručuje studiovou věrnost.

Modely Eleven v4 i Eleven v4 Turbo jsou ode dneška dostupné v prostředí ElevenAgents, kreativním rozhraní ElevenCreative i prostřednictvím standardního vývojářského API na oficiálním webu ElevenLabs.

Kde je model Eleven v4 dostupný a jak jej vyzkoušet?

Oba modely, tedy plný Eleven v4 i rychlý Eleven v4 Turbo, jsou k dispozici přímo ve webovém rozhraní ElevenLabs, v nástroji ElevenAgents pro stavbu hlasových asistentů a také přes programátorské API pro vývojáře.

V čem se liší základní Eleven v4 od verze Turbo?

Základní Eleven v4 nabízí maximální věrnost emocí a hodí se pro audioknihy, herní dabing, podcasty a předtočená videa. Verze Turbo je optimalizována na minimální latenci s odezvou okolo 150 ms, což z ní dělá volbu pro živé konverzační agenty a telefonní linky.

Kolik nahrávek je potřeba k naklonování hlasu?

Pro okamžitý hlasový klon (Instant Voice Clone) postačí v nové verzi pouhých 10 sekund kvalitního mluveného slova. Pro nejvyšší věrnost u profesionálních projektů lze využít režim Professional Voice Clone s delším trénovacím vzorkem.

X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.