Mihu provozuje kompletní stack AI agentů — od řeči a uvažování až po telefonii a akce — uvnitř vaší infrastruktury. Data zákazníků nemusí opustit vaše prostředí.
Mihu AI On-Premise je podniková nabídka, která organizacím umožňuje provozovat kompletní stack AI agentů Mihu ve vlastní infrastruktuře.
Zpracování řeči, AI inference, orchestrace, telefonie, integrace, aplikační služby a ukládání dat mohou fungovat, aniž by data zákazníků opustila prostředí organizace.
Celé nasazení se dodává jako kontejnerizované služby Docker a běží na infrastruktuře spravované zákazníkem, nasazené na Kubernetes pomocí Rancher nebo Helm.
Mihu poskytuje vlastní hlasové modely — Mihu STT (Speech-to-Text) a Mihu TTS (Text-to-Speech) — kompletně on-premise. Pro podporovaná nasazení:
Těchto 7 jazyků běží výhradně na vlastních STT a TTS modelech Mihu uvnitř vaší infrastruktury. Cloudová platforma Mihu podporuje více než 40 jazyků prostřednictvím dalších hlasových modelů.
Řečová infrastruktura Mihu je navržena tak, aby udržela nároky na inferenci nízké. V závislosti na jazyce a konfiguraci modelu mají nasazované řečové modely přibližně 66M – 143M parametrů.
Díky tomu je možné provozovat STT a TTS zátěž na CPU infrastruktuře, aniž by pro každou hlasovou zátěž byla nutná vyhrazená GPU.
Hodnoty souběžnosti se stanovují pro každé nasazení pomocí benchmarků na cílovém hardwaru, neuvádějí se jako pevný poměr CPU k počtu hovorů.
Vlastní řečová data a hlasy značky zůstávají v infrastruktuře, kterou spravujete.
Organizace s kvalitními vlastními řečovými daty mohou řečovou vrstvu dále přizpůsobit. Mihu může podporované STT/TTS modely doladit přímo v infrastruktuře spravované zákazníkem, takže vlastní datové sady není nutné předávat externímu poskytovateli inference.
Obzvláště užitečné pro organizace se specializovanou slovní zásobou, regionálními přízvuky nebo přísnými požadavky na lokalitu uložení dat.
Mihu On-Premise podporuje také privátní klonování hlasu. Dodané hlasové vzorky lze použít k vytvoření hlasů specifických pro danou organizaci, které jsou následně hostovány ve vlastní infrastruktuře zákazníka.
Zdrojové nahrávky i výsledný hlasový model mohou zůstat privátní.
Podniky tak mohou vytvářet konzistentní hlasy značky, aniž by se při produkční inferenci spoléhaly na externího poskytovatele TTS.
Požadavek na hlasový vzorek: přibližně 30 sekund čisté řeči nahrané bez dlouhých pauz či mezer mezi větami.
Odlehčené řečové modely pro CPU jsou primárně jazykově specifické, nikoli jeden vícejazyčný model. Pro AI agenty, kteří potřebují dynamicky měnit jazyk během téže interakce, podporuje Mihu několik strategií nasazení.
Souběžně běží více jazykově specifických řečových modelů. Orchestrační vrstva Mihu detekuje nebo přijímá aktivní jazyk a dynamicky směruje zpracování řeči na odpovídající model.
Volbu modelu během interakce mohou řídit i systémová pravidla s vyšší prioritou.
Pro scénáře vyžadující vysoce dynamické vícejazyčné konverzace lze místo toho nasadit větší vícejazyčné řečové modely na GPU infrastruktuře.
Architektura je podle typu zátěže optimalizována buď na efektivitu CPU s jazykově specifickými modely, nebo na maximální vícejazyčnou flexibilitu s modely na GPU.
Poznámka: vícejazyčné STT i vícejazyčné TTS vyžadují GPU infrastrukturu. Čistě CPU cesta platí pro jazykově specifické modely Mihu STT a Mihu TTS.
Vrstva uvažování běží zcela uvnitř vašeho prostředí na open-weight LLM: na modelech, jejichž váhy jsou veřejně uvolněné a které mohou běžet plně offline na vašem vlastním hardwaru, bez připojení k dodavateli modelu. Mihu průběžně vyhodnocuje nové open-weight modely namísto trvalého navázání on-premise stacku na jedinou rodinu modelů.
Vysoce výkonná nasazení LLM obvykle vyžadují GPU infrastrukturu. Doporučený model se může měnit s tím, jak přicházejí nové modely, a Mihu může model pro uvažování aktualizovat nebo nahradit nezávisle na zbytku infrastruktury agentů.
Infrastruktura je nezávislá na modelu. Nejlepší dostupný model se může změnit; vaše architektura nemusí.
Model uvažování se vybírá v době nasazení z aktuální evaluační sady. K září 2026 je jednou z našich preferovaných výkonných konfigurací Kimi K2.6 Instant. Běží na dedikované GPU infrastruktuře poskytované nad rámec základu 128 vCPU. Tam, kde platí požadavky na způsob pořízení nebo původ modelu, lze zvolit open-weight alternativy od jiných dodavatelů a z jiných regionů, například Llama nebo Mistral. Výběr se potvrzuje v každé nabídce nasazení.
Plné nasazení Mihu On-Premise se skládá z několika nezávislých služeb. Všechny základní komponenty se dodávají jako kontejnerizované služby Docker a nasazují se na Kubernetes pomocí Rancher nebo Helm.
Základní běhové prostředí AI agentů a byznysová logika.
Koordinuje řečové modely, LLM, agenty a běhové služby.
Vrstva komunikace v reálném čase mezi službami a relacemi agentů.
Zajišťuje podnikovou telefonii a SIP konektivitu.
Podporuje odchozí a objemově náročné komunikační zátěže.
Vykonává nástroje, integrace a akce agentů.
Rozhraní pro administraci, konfiguraci a provozní správu.
Trvalé ukládání aplikačních a provozních dat.
Stav v reálném čase, cachování a distribuovaná koordinace běhu.
On-premise lze nasadit i další funkce Mihu. Tyto komponenty vyžadují podle využití dodatečnou serverovou kapacitu.
Pro generování a spouštění vlastních služeb, kódu, integrací a workflow. Provoz Builderu vyžaduje dodatečnou GPU kapacitu na serveru.
Pro zpřístupnění workspace Mihu a jeho funkcí AI systémům kompatibilním s MCP.
Propojuje vaši stávající PBX nebo telefonní systém s SIP infrastrukturou Mihu pro příchozí i odchozí hovory.
Vyžadován, pokud chcete připojit e-mailový kanál. E-maily agentů a notifikace se odesílají přes váš vlastní SMTP server.
Produkční nasazení by měla zahrnovat vyhrazenou infrastrukturu pro observabilitu. Mihu doporučuje samostatnou infrastrukturu pro centrální logování a monitoring.
Logy z Mihu Core, orchestrace, SIP, relay vrstvy, model serverů a aplikačních služeb jsou sbírány centrálně.
Metriky infrastruktury a aplikací jsou průběžně monitorovány. Při překročení předem definovaných provozních prahů lze generovat výstrahy.
Všechny služby Mihu běží na serverech uvnitř vlastní sítě zákazníka. Pro produkční provoz není vyžadována žádná VPN, tunel ani trvalé spojení s Mihu.
Interní AI služby nemusí být veřejně vystaveny. Telefonie se do SIP infrastruktury dostává přes stávající připojení zákazníka k operátorovi nebo PBX a síťová pravidla jsou plně definována infrastrukturními a bezpečnostními politikami zákazníka.
Pro produkční instalaci Mihu On-Premise se výchozí konfigurace infrastruktury určuje podle očekávané souběžnosti a zátěže.
Základ 128 vCPU pokrývá služby Mihu Core a STT/TTS na CPU. Nepokrývá vrstvu uvažování: výkonný vlastní hostovaný LLM, jako je Kimi K2.6 Instant, vyžaduje nad rámec tohoto základu dedikovanou GPU infrastrukturu dimenzovanou podle zvoleného modelu a očekávané souběžnosti. Volba menšího open-weight modelu odpovídajícím způsobem snižuje nároky na GPU. GPU kapacita se přidává i tehdy, když jsou vyžadovány vícejazyčné hlasové modely na GPU. Přesné přidělení závisí na souběžných AI konverzacích, zátěži STT/TTS, nasazených jazycích, volbě LLM, konfiguraci redundance a doplňkových službách, jako jsou Builder a MCP.
Rozdělení mezi fyzická jádra a vCPU je potvrzeno v návrhu nasazení.
Požadavky na úložiště závisí především na tom, zda jsou nahrávky hovorů a další média uchovávány lokálně. Aplikační databáze Mihu vyžadují trvalé úložiště, zatímco kapacita pro nahrávky se počítá zvlášť. Zákazníci uchovávající nahrávky měsíce nebo roky by měli vyčlenit samostatný svazek úložiště dimenzovaný podle své politiky uchování.
Produkční architekturu lze nakonfigurovat s redundancí napříč kritickými službami Mihu. Dosažení tohoto cíle vyžaduje udržování dohodnuté produkční architektury, redundance a požadavků na infrastrukturu.
Pro podnikové on-premise instalace je přidělena vyhrazená provozní odpovědnost. Nedojde-li k výpadkům podkladové infrastruktury nebo hardwaru mimo provozní odpovědnost Mihu, je nasazení navrženo na dohodnutý cíl dostupnosti služby 99.9%. Odpovědnosti jednotlivých vrstev jsou vymezeny v dokumentu SLA.
Kompletní stack Mihu je poskytován jako předkonfigurované Docker služby. Inženýrský tým Mihu zajišťuje konfiguraci nasazení a připravenost na produkci společně s infrastrukturním týmem zákazníka. Typické on-premise nasazení je dodáno za 3–6 měsíců, od přípravy infrastruktury až po produkci, a je k dispozici podnikovým zákazníkům.
Kubernetes: stack lze nasadit pomocí Helm chartů. Standardní a nejrychlejší cestou Mihu je nasazení Kubernetes spravované nástrojem Rancher.
Mihu On-Premise používá verzování založené na větvích: každé zákaznické nasazení běží na vlastní release větvi a aktualizace jsou dodávány jako měsíční vydání. Každé vydání je před nasazením ověřeno a aplikováno v koordinaci s infrastrukturním týmem zákazníka, takže upgrady jsou plánované, nikoli vynucené. Validace vydání zahrnuje standardní sadu testů; některé jednotkové testy se mohou lišit v závislosti na zákaznických úpravách.
Ke každému on-premise prostředí přiděluje Mihu tým customer success a tým DevOps, které spolupracují s vaším týmem. Podpora probíhá prostřednictvím sdílené skupiny na Slacku, takže provozní dotazy, koordinace vydání a incidenty se řeší přímo s lidmi, kteří vaše nasazení znají.
Jednostránkový přehled toho, co kde běží v nasazení Mihu On-Premise.
Kompletní stack: Speech-to-Text, Text-to-Speech, klonování hlasu, LLM vrstva uvažování, orchestrace, SIP telefonie, Action Server pro integrace, správcovská aplikace a databázová a Redis vrstva. Data zákazníků nemusí opustit vaše prostředí.
Pro řečovou vrstvu ne. STT a TTS běží na CPU s modely o velikosti zhruba 66M až 143M parametrů. Vysoce výkonné open-weight LLM obvykle vyžadují GPU infrastrukturu a kapacita GPU se doplňuje také tehdy, zvolíte-li větší vícejazyčné řečové modely.
Aktuální on-premise hlasový stack běžící na CPU podporuje sedm jazyků: angličtinu, němčinu, francouzštinu, španělštinu, italštinu, ruštinu a turečtinu. Tyto jazykově specifické modely Mihu STT a Mihu TTS běží na CPU, bez GPU. Mihu STT obvykle dosahuje přibližně 5–9 % chybovosti slov (WER); přesná hodnota závisí na jazyce a evaluační datové sadě.
Vrstva uvažování je nezávislá na modelu a běží na open-weight modelech. Mihu doporučuje model k datu nasazení a pro splnění požadavků na způsob pořízení nebo původ modelu lze zvolit alternativy od jiných dodavatelů a z jiných regionů, například Llama nebo Mistral vedle Kimi K2.6 Instant. Model lze aktualizovat nebo nahradit nezávisle na zbytku infrastruktury agentů, jakmile budou k dispozici lepší open-weight modely.
Ano. Podporované STT a TTS modely lze doladit v infrastruktuře pod kontrolou zákazníka s využitím vašich vlastních datových sad, takže vlastní audio se nikdy nedostane k externímu poskytovateli. Výsledné modely zůstávají privátní pro vaši organizaci.
Typický produkční základ začíná na 128 vCPU pro základní služby Mihu a hlasovou vrstvu na CPU. Vlastní hostovaný LLM se dimenzuje samostatně a vyžaduje nad rámec tohoto základu dedikovanou GPU infrastrukturu; GPU kapacita se přidává i pro vícejazyčné hlasové modely na GPU. Úložiště se dimenzuje podle vaší politiky uchovávání nahrávek a přepisů. Přesné dimenzování se potvrzuje v nabídce nasazení.
Vše se dodává jako předkonfigurované služby Docker a běží na vlastních serverech zákazníka. Pro produkční provoz není vyžadována VPN ani zpětné spojení s Mihu a žádná interní AI služba nemusí být veřejně vystavena. Inženýrský tým Mihu zajišťuje konfiguraci nasazení společně s vaším infrastrukturním týmem.
Ano. Nové jazyky lze přidat na vyžádání. Náročnost trénování se liší podle jazykové skupiny a STT a TTS se trénují odděleně. Mihu může trénovací datovou sadu pro vás zajistit nebo zakoupit, případně pracovat s daty, která poskytnete. Trénování probíhá na strojích, které dodáte, nebo na infrastruktuře poskytnuté Mihu, a výsledné modely Mihu STT a Mihu TTS se poté nasadí do vašeho prostředí úplně stejně jako standardní modely.
Sdělte nám očekávanou souběžnost, jazyky a požadavky na lokalitu uložení dat. Náš inženýrský tým se ozve s návrhem dimenzování a plánem nasazení.