OpenAI a čipová firma Cerebras 13. srpna 2026 představily Ultrafast režim pro model GPT-5.6 Sol - podle obou firem dokáže generovat až přibližně 750 výstupních tokenů za sekundu, tedy až 14× rychleji než standardní zpracování (které běží kolem 53 tokenů za sekundu). Model si přitom podle OpenAI drží stejnou „inteligenci“ jako standardní GPT-5.6 Sol - jde jen o rychlost generování, ne o jiný, slabší model.
Co to znamená v praxi
Na benchmarku Humanity's Last Exam (2 500 otázek) zvládl GPT-5.6 Sol na Ultrafast režimu odpovědět na všechny otázky za 11 hodin a 11 minut - srovnatelný výsledek u Claude Fable 5 trval 78 hodin a 27 minut. Ultrafast zatím běží jako omezený náhled v API pro vybranou skupinu zákazníků, přístup se má postupně rozšiřovat s tím, jak poroste kapacita.
Pro koho to má smysl
OpenAI cílí režim hlavně na aplikace, kde záleží na rychlosti odezvy v reálném čase - hlasové asistenty, finanční research nebo reakci na bezpečnostní incidenty (incident response), tedy případy, kde dřív bylo nutné kvůli rychlosti sáhnout po menším, slabším modelu.
Proč na tom záleží
Číslo „750 tokenů za sekundu“ samo o sobě nic neřeší - důležitější je trend, který ukazuje. Pokud se nejvýkonnější (frontier) modely dostanou na rychlosti srovnatelné s malými modely, mizí kompromis mezi „chytré, ale pomalé“ a „rychlé, ale hloupé“. To může výrazně posunout hlasové asistenty, coding agenty, realtime analýzu dat nebo autonomní aplikace, které dosud musely rychlost řešit ústupkem v kvalitě.