Nejde jen o rychlejší odpověď
Na první pohled to zní jako další závod v čísle, které běžný uživatel nepozná. Chatbot odpoví za dvě sekundy místo za pěti a svět se nezastaví. U některých typů práce však rychlost neurčuje pouze komfort, ale také to, zda je možné AI vůbec použít.
Rozdíl je podobný jako mezi e-mailem a telefonním hovorem. U e-mailu nevadí, když odpověď přijde za několik minut. V hlasové podpoře, při řešení výpadku serveru nebo během kontroly podezřelé transakce ale uživatel čekat nechce. Pokud model dlouho přemýšlí mezi jednotlivými kroky, interaktivní služba začne působit jako člověk, který si před každou větou odchází uvařit kávu.
OpenAI proto Ultrafast nepopisuje pouze jako vyšší počet tokenů za sekundu. Hlavní myšlenkou je spojit vyšší inteligenci GPT-5.6 Sol s nízkou odezvou. Dosud bylo běžné, že firmy pro rychlé odpovědi volily menší nebo specializované modely. Ty byly levnější a svižnější, ale nemusely zvládnout složitý problém, práci s více nástroji nebo delší řetězec rozhodnutí.
OpenAI uvádí, že Ultrafast spouští nejdříve v API a v omezeném preview režimu. Přístup má zatím pouze vybraná skupina zákazníků. Firma chce sledovat, kde přináší řádové zvýšení rychlosti největší hodnotu, a teprve poté rozšiřovat kapacitu. ([openai.com](https://openai.com/index/previewing-ultrafast))
Co přesně znamená 750 tokenů za sekundu
Token není totéž co slovo. Jde o menší část textu — někdy celé slovo, jindy jeho část, mezeru nebo interpunkční znak. Přesný poměr se liší podle jazyka a obsahu. Číslo 750 tokenů za sekundu proto nelze jednoduše přeložit na 750 slov.
Pro představu: odpověď dlouhá přibližně 750 tokenů může být v češtině několik stovek slov. Při ideálních podmínkách by ji model mohl vygenerovat zhruba za sekundu. V praxi však celkovou dobu ovlivňuje také síť, délka vstupního promptu, čekání na nástroje, databáze, bezpečnostní kontroly a případné další kroky agenta. 750 tokenů za sekundu tedy není záruka, že každá aplikace odpoví okamžitě.
OpenAI mluví o zrychlení až 14× proti standardnímu zpracování. Cerebras ve vlastním popisu spolupráce uvádí u GPT-5.6 Sol rychlost 750 tokenů za sekundu a až desetinásobný náskok proti běžnému režimu Sol. Rozdíl pravděpodobně souvisí s použitou referenční konfigurací — OpenAI porovnává Ultrafast se standardním zpracováním, zatímco Cerebras pracuje s jinou základní hodnotou. Není proto správné tato dvě čísla mechanicky sčítat nebo z nich dělat univerzální výkonový slib.
Cerebras dodává jiný typ železa
Ultrafast pohání hardware Cerebras. Společnost se zaměřuje na takzvané wafer-scale procesory, tedy velmi rozměrné čipy navržené pro úlohy umělé inteligence. Zjednodušeně řečeno: místo rozdělování výpočtu mezi velké množství menších čipů se snaží udržet více práce na jednom obřím výpočetním celku.
U jazykových modelů je rychlost generování ovlivněna tím, jak rychle systém zvládá opakovaný proces tvorby dalšího tokenu. Každý nový token navazuje na předchozí kontext. Pokud hardware zkrátí čekání mezi těmito kroky, odpověď začne plynout téměř jako text psaný živým člověkem, nikoli jako dávka dat dorazivší po krátkém přemýšlení.
To ale neznamená, že Cerebras nahrazuje OpenAI nebo že se GPT-5.6 Sol přesouvá do běžného notebooku. Jde o infrastrukturu na straně poskytovatele. Vývojář si zavolá model přes API a rychlost se projeví v aplikaci, pokud má přístup k Ultrafast režimu a jeho parametry to dovolí.
Kde může nízká latence skutečně pomoct
Řešení výpadků a provozní incidenty
Při havárii systému se mění situace každou minutou. Přibývají nové logy, technici nasazují opravy a některé hypotézy přestávají platit. Rychlejší model může průběžně procházet logy, trasování požadavků, změny v kódu a interní komunikaci. Jeho úloha není rozhodnout místo člověka, ale zkrátit dobu mezi signálem, hypotézou a dalším ověřením.
Hlasová zákaznická podpora
U hlasového asistenta se zpoždění násobí. Uživatel položí otázku, model musí dohledat údaje v interních systémech, zkontrolovat podmínky a vytvořit odpověď. Pokud každá část trvá příliš dlouho, hovor začne připomínat vysílačku se špatným signálem. Ultrafast může pomoci hlavně u případů, které nejsou jednoduchým dotazem na stav objednávky, ale vyžadují více kroků a práci s několika systémy.
Výzkum a experimenty
OpenAI popisuje také scénáře, ve kterých týmy ráno kontrolují výpočty spuštěné přes noc. Pokud se některé analytické smyčky zkrátí na desítky minut nebo dobu vhodnou pro interaktivní práci, výzkumník může během dne upravit hypotézu a spustit další variantu. To není kouzlo, které odstraní potřebu kvalitních dat. Je to spíše rychlejší zpětná vazba — a ta bývá ve výzkumu často cennější než další barevný graf.
GPT-5.6 Sol proti konkurenci: čísla s poznámkou pod čarou
OpenAI uvádí, že GPT-5.6 Sol dosahuje v benchmarku Agents’ Last Exam skóre 53,6. Firma ho porovnává s modelem Claude Fable 5, který měl podle stejného oznámení o 13,1 bodu méně. V indexu Artificial Analysis Intelligence Index se má GPT-5.6 Sol při maximálním uvažování přiblížit Fable 5 na rozdíl jediného bodu, přičemž OpenAI uvádí o 61 procent kratší dobu dokončení a přibližně poloviční odhadované náklady.
V úlohách práce s počítačem OpenAI uvádí pro GPT-5.6 Sol skóre 62,6 procenta v OSWorld 2.0 a 90,4 procenta v BrowseComp. Varianta Sol Ultra dosahuje v BrowseComp 92,2 procenta. V tabulkách se objevují také srovnání s modely Claude a Gemini. Tato čísla je však potřeba číst jako výsledky zveřejněné samotným OpenAI. Benchmarky mají různé režimy uvažování, náklady, počty agentů i metodiky. Nejde tedy o univerzální ligovou tabulku, kde by jeden model vyhrál každou možnou disciplínu.
Praktický závěr je střízlivější: GPT-5.6 Sol podle zveřejněných testů míří na špičku u dlouhých agentních úloh, programování a práce s nástroji. Ultrafast k tomu přidává rychlost. Neřeší ale automaticky přesnost, kvalitu vstupních dat ani riziko špatně nastavené automatizace. Rychlá chyba je pořád chyba. Jen přijde dříve.
Kompletní představení GPT-5.6 uvádí také výsledky v BrowseComp, OSWorld 2.0, kyberbezpečnostních a vědeckých testech. OpenAI zároveň upozorňuje, že některé odhady latence a ceny vycházejí ze simulací a skutečné výsledky se mohou lišit podle konkrétního workflow. ([openai.com](https://openai.com/index/gpt-5-6/))
Cena a dostupnost v Česku
U režimu Ultrafast OpenAI zatím v oznámení neuvádí samostatný ceník. Přístup je omezený a dostupnost se rozšiřuje postupně. Pro běžného uživatele v Česku to znamená, že si Ultrafast dnes jednoduše nezapne v ChatGPT jako další přepínač rychlosti.
Standardní API cena GPT-5.6 Sol je podle aktuálního ceníku OpenAI 5 dolarů za milion vstupních tokenů a 30 dolarů za milion výstupních tokenů. Počítání probíhá podle skutečného využití, takže výsledná částka závisí na délce kontextu, počtu opakovaných volání a práci s nástroji. Samotná cena Ultrafast režimu pro omezené preview není veřejně uvedena.
OpenAI nabízí GPT-5.6 v ChatGPT, Codexu i API a dokumentace uvádí vícejazyčné schopnosti modelové rodiny. Čeština tedy spadá do širší vícejazyčné podpory, ale Ultrafast není v oznámení prezentován jako zvláštní česká lokalizace. Pro české firmy bude podstatnější API dostupnost, smluvní podmínky, ochrana dat a to, zda se podaří rychlost využít v konkrétní aplikaci bez toho, aby se čekalo na další interní systémy.
Aktuální ceny standardních modelů GPT-5.6 se v průběhu července měnily, například u modelů Terra a Luna. OpenAI proto doporučuje pracovat s aktuálním srovnáním modelů a cen v dokumentaci API, nikoli se starými tabulkami z článků nebo screenshoty z prezentací. ([openai.com](https://openai.com/index/gpt-5-6/))
Komu Ultrafast dává smysl
Největší přínos lze čekat u firem, kde AI odpovídá v reálném čase, zpracovává živá data nebo koordinuje více kroků v krátké interakci. Patří sem hlasová podpora, dohled nad systémy, finanční analýza, bezpečnostní triage, e-commerce a vývojářské nástroje.
Pro běžné psaní e-mailů, shrnutí dokumentů nebo jednorázové generování textu nebude 14násobné zrychlení automaticky znamenat stejně velkou úsporu. V takovém případě může být důležitější cena, přesnost, délka kontextu nebo dostupnost nástrojů. Pokud člověk čeká na schválení kolegy, dodání podkladů nebo vlastní nápad, model může generovat i rychlostí světla a workflow se stejně zastaví u kalendáře.
Ultrafast je proto zajímavý hlavně jako infrastruktura pro nové typy aplikací. Zatím nejde o veřejnou funkci pro každého, ale o omezený test toho, co se stane, když špičkový model přestane být úzkým hrdlem interaktivní služby. Odpověď OpenAI zatím zní: největší hodnotu nemusí mít více inteligence nebo nižší cena zvlášť, ale více užitečné práce za jednu sekundu.
FAQ
Je GPT-5.6 Sol Ultrafast dostupný v běžném ChatGPT?
Ne. K 15. srpnu 2026 je Ultrafast dostupný pouze v omezeném preview režimu pro vybrané zákazníky OpenAI API. OpenAI zatím neoznámilo běžné zapnutí této funkce pro všechny uživatele ChatGPT.
Znamená 750 tokenů za sekundu, že každá odpověď přijde za jednu sekundu?
Ne. Jde o maximální rychlost generování výstupu v konkrétních podmínkách. Celkovou odezvu ovlivňuje síť, délka vstupu, práce s nástroji, bezpečnostní kontroly i případné čekání na externí systémy.
Je Ultrafast vhodný pro české uživatele?
Technicky může být relevantní pro české firmy a vývojáře, protože GPT-5.6 podporuje vícejazyčné použití. Omezením je současná dostupnost: Ultrafast není veřejnou funkcí ChatGPT a OpenAI zatím neoznámilo samostatnou českou nabídku ani veřejný příplatek.
Zdroje: OpenAI: Previewing Ultrafast mode, OpenAI: GPT-5.6, OpenAI: ceny a výkon GPT-5.6, OpenAI API: srovnání modelů, Cerebras: GPT-5.6 na platformě Cerebras.