Trapné mlčení po otázce, dvě sekundy ticha, než hlasový asistent začne odpovídat — to je něco, co každý zná z volání na infolinku. Thinking Machines Lab, startup bývalé technické šéfky OpenAI Miry Murati, představil 11. května 2026 novou architekturu AI, která tuto pauzu prakticky maže. Model TML-Interaction-Small reaguje za 0,4 sekundy — což je přibližně rychlost lidské konverzace.
Podle VentureBeatu je to první veřejně oznámený model startupu, který v červenci 2025 získal rekordní seedové kolo 2 miliard dolarů. A pro firmy, které zvažují nasazení hlasové AI, je to potenciálně zlomová zpráva.
Co jsou Interaction Models a v čem se liší
Klasické hlasové AI (ChatGPT Voice Mode, Google Gemini Live) fungují sekvenčně: uživatel mluví → systém přepíše řeč na text → jazykový model přemýšlí → vygeneruje odpověď → převede ji zpět na řeč. Mezi „přestal jsem mluvit“ a „AI odpověděla“ je vždy znatelná pauza.
Thinking Machines tvrdí, že tento přístup je špatný od základu. Místo skládání několika modelů za sebe postavili jeden nativně multimodální model, který příchozí audio i odchozí audio zpracovává jako paralelní datové toky. Model čte vstup a generuje výstup v 200ms blocích současně — tedy poslouchá a mluví zároveň, podobně jako člověk.
V praxi to znamená, že model umí:
- Backchannely — během toho, co mluvíte, vám prohodí „mhm“, „jasně“ nebo „aha“, aniž by musel čekat na konec věty.
- Přerušit vás, když si všimne, že jste řekli něco nepřesného nebo když je odpověď zřejmá ještě před koncem otázky.
- Reagovat na vizuální podnět, který se objeví v kameře, i když právě mluvíte o něčem jiném.
Podle oficiálního blogového příspěvku Thinking Machines jde o architekturu Mixture-of-Experts s 276 miliardami parametrů (12 miliard aktivních), takže nejde o malý experimentální model — je to seriózní pokus o nový standard.
0,4 sekundy — proč je to hranice, která mění hru
Lidé v běžné konverzaci přebírají slovo v průměru za 200–500 milisekund. Cokoli pomalejšího vnímáme jako zaváhání nebo nepříjemné ticho. Tady jsou aktuální čísla podle The Decoderu:
- TML-Interaction-Small (Thinking Machines): 0,40 s
- Gemini 3.1 Flash Live (Google): 0,57 s
- GPT-realtime-2.0 (OpenAI): 1,18 s
Rozdíl mezi 0,4 a 1,2 sekundy se na papíře nezdá velký. V hovoru je to ale propast mezi „mluvím s asistentkou“ a „mluvím s automatem“. Pokud někdy zákazník zavolal na linku a po každé větě čekal — víte, o čem mluvíme.
Co to znamená pro hlasové asistenty v českých firmách
Hlasová AI byla v posledních dvou letech v Česku stále spíš zajímavost než produkční nástroj. Důvod byl prostý: latence kolem 1 sekundy plus občasné halucinace dělaly z hovoru frustraci. Zákazníci se rychle naučili poznat, že volají s robotem, a požadovali člověka.
Pokud se architektura Interaction Models prosadí (a všechno nasvědčuje, že se Google s OpenAI rychle přidají), otevírá se prostor pro:
- Příchozí infolinky první úrovně — kde AI vyřeší 60–80 % rutinních dotazů (otevírací doba, stav objednávky, jednoduchá změna údajů) bez přepojení.
- Odchozí kampaně — domluvení termínu, ověření zájmu, follow-up po nabídce. Tam, kde dnes call centra najímají brigádníky.
- Interní hlasové rozhraní — terénní pracovníci, kteří diktují report z místa zásahu a AI ho strukturovaně zaznamenává a doplňuje další otázky.
- Voice-first onboarding v aplikacích, kde uživatelé místo vyplňování formuláře vedou krátký rozhovor.
To všechno už dnes technicky jde postavit — ale teprve s latencí pod půl sekundy to přestane být demo a začne to být něco, co zákazník po dvou minutách nepozná, že je to AI.
Zvažujete, jestli má smysl hlasovou AI v některém procesu testovat ještě letos, nebo počkat až bude technologie zralejší? V Praxiu tyhle úvahy projdeme s vámi krok za krokem — řekneme vám i to, co nechcete slyšet, a poskytneme nezávislý pohled bez závislosti na jednom dodavateli. První konzultace je zdarma, napište nám.
Konkurenční tlak: OpenAI, Google a Mistral nezahálejí
Thinking Machines není sám. Konkurence se hlasovou AI zabývá intenzivně — jen z jiného úhlu:
- OpenAI postupně vylepšuje GPT Realtime API a v dubnu 2026 představil verzi 2.0 s nižší latencí, ale stále operuje na sekvenční architektuře.
- Google s Gemini 3.1 Flash Live ukázal nativně multimodální zpracování video + audio + text najednou bez mezistupňů — což je technicky podobný směr, jakým jde Thinking Machines.
- Mistral v květnu 2026 spustil Le Chat Work mode s modelem Medium 3.5 (128B parametrů) — soustředí se ale na text-based agentní úkoly, ne na hlas.
Pro firmy je důležité, že během roku 2026 se očekává, že všichni velcí hráči full-duplex hlasovou AI nabídnou. Sázka na konkrétní platformu dnes by byla předčasná — větší smysl má udělat audit procesů, kde má hlas reálnou návratnost, a počkat 3–6 měsíců, jak se trh poskládá.
Kdy si Interaction Models můžete vyzkoušet
Thinking Machines zatím model veřejně nevydal. V příštích měsících plánuje limitovaný research preview pro vybrané vývojáře a výzkumníky. Širší dostupnost (pravděpodobně přes API) Murati slíbila „později v roce 2026″ — bez konkrétního data.
Praktický odhad: komerčně použitelná verze (přes API, s SLA) přijde nejdříve na podzim 2026, spíš ale v Q1 2027. Pokud řešíte voicebot projekt už dnes, počítejte s OpenAI Realtime nebo Gemini Live jako s rozumnou volbou a navrhujte architekturu tak, aby šlo model později vyměnit.
FAQ — Často kladené otázky
Co je TML-Interaction-Small a jak se liší od ChatGPT?
TML-Interaction-Small je první model startupu Thinking Machines Lab. Jde o Mixture-of-Experts model s 276 miliardami parametrů (12 miliard aktivních), který je navržený pro hlasovou a video komunikaci v reálném čase. Hlavní rozdíl oproti ChatGPT je v architektuře: ChatGPT je primárně textový model, ke kterému je hlasová schopnost přidaná externě. TML-Interaction-Small zpracovává vstupní a výstupní audio paralelně jako rovnocenné datové toky.
Jaká je latence Interaction Models v porovnání s konkurencí?
TML-Interaction-Small dosahuje turn-taking latence 0,40 sekundy. Pro srovnání: Google Gemini 3.1 Flash Live má 0,57 sekundy a OpenAI GPT-realtime-2.0 má 1,18 sekundy. Pro kontext, lidská konverzace má průměrnou pauzu mezi mluvčími 200–500 milisekund.
Kdo je Mira Murati a proč na ní záleží?
Mira Murati byla od roku 2022 do září 2024 technickou ředitelkou (CTO) OpenAI a spoluvedla vývoj ChatGPT, DALL-E a Sora. V roce 2025 založila Thinking Machines Lab spolu s několika dalšími bývalými inženýry OpenAI včetně Johna Schulmana. Startup v červenci 2025 získal seedové kolo 2 miliard dolarů — rekord pro AI startup bez veřejného produktu.
Můžou si Interaction Models už dnes firmy vyzkoušet?
Ne. Thinking Machines plánuje v následujících měsících spustit limitovaný research preview pro vybrané partnery, široká dostupnost přes API se očekává koncem roku 2026 nebo začátkem 2027. Pro produkční nasazení hlasové AI dnes je vhodnější OpenAI Realtime API nebo Google Gemini Live.
Zdroje: Thinking Machines Lab — Interaction Models, VentureBeat, The Decoder, TechCrunch, MarkTechPost.