Jak to celé funguje: tři úlohy v jednom modelu
Klasický přepis řeči si představte jako pásovou výrobu, kde sedí tři dělníci a každý dělá jen svou část. První přepisuje slova (odborně ASR, automatické rozpoznávání řeči). Druhý se snaží poznat, kdo právě mluví, aby z přepisu nebyla bezejmenná kaše (diarizace). Třetí hlídá, kdy věta skončila a je čas reagovat (endpointing). Každý z nich je samostatný nástroj, každý má vlastní chyby a každý přidává zpoždění. Muse Voice Transcribe je podle Mety první skutečně audio-percepční model, který všechny tři role zvládne sám a najednou. Je to jeden autoregresivní model — tedy model, který generuje výstup postupně, token za tokenem, podobně jako textový model generuje slova. Zvuk zpracovává po 80milisekundových úsecích s frekvencí 12,5 Hz, takže nemusí čekat, až celá nahrávka skončí. Nejzajímavější detail je takzvané adaptivní zpoždění. Model se učí, jak dlouho má „poslouchat", než se odhodlá k přepisu — a kdy naopak vyčkat, protože mluvčí se jen nadechuje. Tu citlivost mu nastavuje posilované učení (reinforcement learning), tedy stejný princip, který stojí za tím, že si modely jako Claude nebo GPT vylepšují uvažování. Výsledkem je přepis, který funguje plynule i při hodinu trvající schůzce, aniž by se systém postupně zadýchal.Čísla, která rozhodují: benchmarky a cena
Jedna věc je tvrdit, že model je dobrý. Druhá je ukázat čísla. A právě v nich Meta boduje. V testu přesnosti anglického streamovaného přepisu, který provádí nezávislá služba Artificial Analysis, dosáhl Muse Voice Transcribe chybovosti (Word Error Rate, WER) 3,1 %. To znamená, že z každých sto slov jich přibližně tři přepíše špatně — pro srovnání, dobrý lidský přepisovač se pohybuje kolem dvou až tří procent. Jak si stojí proti konkurenci, ukazuje tabulka:- Meta Muse Voice Transcribe — 3,1 %
- Cartesia Ink-2 — 3,4 %
- ElevenLabs Scribe v2 Real-time — 3,6 %
- OpenAI GPT Live Transcribe — 3,9 %
- Google Gemini 3.5 Transcribe — hůře než Meta (přesné číslo Meta neuvádí)
muse-voice-transcribe-1.0 a Meta si účtuje 3 dolary za 1 000 minut audia. To je 0,18 dolaru za hodinu, v přepočtu podle aktuálního kurzu zhruba 4 koruny za hodinu. Pro představu: deset hodin porad měsíčně vás vyjde na 1,80 dolaru, tedy pár desítek korun. Lidský přepis stejného objemu by v Česku stál řádově víc.
Podivný paradox: Llama je open-source, Muse ne
Tady je jeden detail, který by čtenáři Mety neměli přehlédnout. Když Meta v dubnu 2025 vypustila řadu modelů Llama 4 Scout a Maverick, udělala to tradičně otevřeně — váhy jsou volně ke stažení a kdokoli si je může rozjet na vlastním serveru. Muse Voice Transcribe ale jde jinou cestou: váhy modelu zveřejněné nejsou a provozovat ho lze výhradně přes cloudové API Mety. Proč na tom záleží? Protože to signalizuje strategický posun. Hlasová technologie s nízkou latencí je pro Mety cennější jako služba, kterou drží pod kontrolou a kterou může zpoplatnit, než jako otevřený dárek komunitě. Pro vývojáře to znamená jednu praktickou věc: závislost na cloudu, a tedy na dostupnosti a cenách API. Kdo chtěl u Llamy plnou kontrolu nad daty, u Muse ji nemá.Kde to využijete: Fn na Macu a Muse Code
Meta model nezůstal jen u API pro vývojáře. Integrovala ho do aplikace Meta AI pro macOS, kde funguje hlasové diktování do libovolné aplikace — stačí stisknout klávesu Fn a mluvit. Přepis se objeví přímo tam, kde máte kurzor, ať už píšete e-mail, poznámku nebo zprávu. Druhou destinací je Muse Code, vývojářský nástroj Mety, kde se dá hlasem diktovat kód a komentáře. Podle Mety model zvládá rozlišit více než 20 mluvčích v jedné nahrávce a byl trénován na více než 70 jazycích, z nichž 25 je při spuštění plně validovaných. Umí i takzvaný code-switching — tedy plynulé přepínání jazyků uprostřed věty, což ocení každý, kdo v jedné schůzce míchá češtinu s angličtinou.Čeština a dostupnost: zatím bez jasné odpovědi
A tím se dostáváme k otázce, kterou si český čtenář položí jako první: funguje to s češtinou? Meta sice uvádí 70 trénovaných jazyků, ale kompletní seznam 25 plně validovaných jazyků při spuštění nezveřejnila. Nevíme proto, jestli je mezi nimi i čeština, nebo zda na ni zatím připadá jen částečná podpora. To je férové říct rovnou — dokud Meta seznam nezveřejní, je tvrzení „umí česky" jen přání. Samotná dostupnost pro české uživatele ale problém není: API i aplikace Meta AI fungují i v Česku, takže kdo přepisuje primárně anglicky (porady v angličtině, podcasty, diktování), může model využít hned. Pro ryze české nahrávky doporučuji počkat na potvrzenou jazykovou podporu nebo si model prostě otestovat na vlastní ukázce.Je Muse Voice Transcribe open-source jako Llama?
Ne. Na rozdíl od Llama 4 Scout a Maverick nejsou váhy modelu zveřejněné a Muse Voice Transcribe se provozuje výhradně přes cloudové API Mety. Pro firmy, které potřebují mít data pod vlastní kontrolou, to znamená závislost na cloudu.
Kolik přesně stojí přepis hodiny audia?
Meta si účtuje 3 dolary za 1 000 minut, tedy 0,18 dolaru (zhruba 4 koruny) za hodinu audia. Cena se účtuje za zpracovaný zvuk, nikoli za počet tokenů jako u textových modelů.
Nahradí Muse Voice Transcribe lidské přepisovače?
U angličtiny se chybovostí 3,1 % už model přibližuje kvalitě dobrého lidského přepisu, takže u rutinních nahrávek je reálnou alternativou. U odborné terminologie, silných přízvuků nebo právně citlivých záznamů zůstává lidská kontrola a oprava na místě.