Mihu AI On-Premise

Vaši agenti. Vaše modely. Vaše hlasy. Vaše infrastruktura. Vaše data.

Mihu provozuje kompletní stack AI agentů — od řeči a uvažování až po telefonii a akce — uvnitř vaší infrastruktury. Data zákazníků nemusí opustit vaše prostředí.

7
Jazyky řeči on-premise
CPU
Inference Mihu STT a TTS
99.9%
Cílová dostupnost
Hranice nasazení
Uvnitř vaší sítě
Telefonie
SIP infrastruktura, broadcast služby
Lokálně
Řeč
Mihu STT, Mihu TTS a klonování hlasu na CPU
Lokálně
Uvažování
Open-weight LLM, provozovaný ve vlastní režii
Lokálně
Akce
Action Server, integrace, workflow
Lokálně
Data
Databáze, Redis, nahrávky, přepisy
Lokálně
Přehled

Privátní hlasová AI infrastruktura nasazená kompletně uvnitř vašeho prostředí.

Mihu AI On-Premise je podniková nabídka, která organizacím umožňuje provozovat kompletní stack AI agentů Mihu ve vlastní infrastruktuře.

Zpracování řeči, AI inference, orchestrace, telefonie, integrace, aplikační služby a ukládání dat mohou fungovat, aniž by data zákazníků opustila prostředí organizace.

Celé nasazení se dodává jako kontejnerizované služby Docker a běží na infrastruktuře spravované zákazníkem, nasazené na Kubernetes pomocí Rancher nebo Helm.

Řeč
On-premise, inference na CPU
LLM
Open weights, ve vlastní režii
Telefonie
SIP uvnitř vaší sítě
Data
Úložiště pod kontrolou zákazníka
Řečová infrastruktura

Mihu STT a Mihu TTS, kompletně on-premise.

Mihu poskytuje vlastní hlasové modely — Mihu STT (Speech-to-Text) a Mihu TTS (Text-to-Speech) — kompletně on-premise. Pro podporovaná nasazení:

  • Mihu STT (Speech-to-Text) běží lokálně.
  • Mihu TTS (Text-to-Speech) běží lokálně.
  • Pro řečovou vrstvu je podporována inference pouze na CPU.
  • Externí řečové API není potřeba.
  • Klonování hlasu lze nasadit uvnitř infrastruktury zákazníka.
  • Audio a trénovací data zákazníka mohou zůstat zcela uvnitř prostředí zákazníka.
Aktuální on-premise řečový stack · 7 jazyků
angličtina němčina francouzština španělština italština ruština turečtina

Těchto 7 jazyků běží výhradně na vlastních STT a TTS modelech Mihu uvnitř vaší infrastruktury. Cloudová platforma Mihu podporuje více než 40 jazyků prostřednictvím dalších hlasových modelů.

5–9%
Typická chybovost slov (WER) současných nasazení Mihu STT (Speech-to-Text) v závislosti na jazyce a evaluační datové sadě.

Odlehčené řečové modely pro CPU

Řečová infrastruktura Mihu je navržena tak, aby udržela nároky na inferenci nízké. V závislosti na jazyce a konfiguraci modelu mají nasazované řečové modely přibližně 66M – 143M parametrů.

Díky tomu je možné provozovat STT a TTS zátěž na CPU infrastruktuře, aniž by pro každou hlasovou zátěž byla nutná vyhrazená GPU.

Skutečná kapacita závisí na
  • souběžných konverzacích
  • zvoleném jazyce
  • zvoleném STT/TTS modelu
  • konfiguraci audia
  • cílové latenci
  • požadavcích na redundanci

Hodnoty souběžnosti se stanovují pro každé nasazení pomocí benchmarků na cílovém hardwaru, neuvádějí se jako pevný poměr CPU k počtu hovorů.

Přizpůsobení

Privátní fine-tuning a klonování hlasu

Vlastní řečová data a hlasy značky zůstávají v infrastruktuře, kterou spravujete.

Privátní fine-tuning

Organizace s kvalitními vlastními řečovými daty mohou řečovou vrstvu dále přizpůsobit. Mihu může podporované STT/TTS modely doladit přímo v infrastruktuře spravované zákazníkem, takže vlastní datové sady není nutné předávat externímu poskytovateli inference.

Vlastní modely lze
  • doladit pomocí datových sad dodaných zákazníkem
  • optimalizovat pro oborovou terminologii
  • přizpůsobit přízvukům a řeči specifické pro danou oblast
  • nasadit výhradně uvnitř infrastruktury zákazníka
  • uchovávány soukromě, zcela v rámci vaší vlastní infrastruktury

Obzvláště užitečné pro organizace se specializovanou slovní zásobou, regionálními přízvuky nebo přísnými požadavky na lokalitu uložení dat.

Klonování hlasu

Mihu On-Premise podporuje také privátní klonování hlasu. Dodané hlasové vzorky lze použít k vytvoření hlasů specifických pro danou organizaci, které jsou následně hostovány ve vlastní infrastruktuře zákazníka.

Zdrojové nahrávky i výsledný hlasový model mohou zůstat privátní.

Podniky tak mohou vytvářet konzistentní hlasy značky, aniž by se při produkční inferenci spoléhaly na externího poskytovatele TTS.

Požadavek na hlasový vzorek: přibližně 30 sekund čisté řeči nahrané bez dlouhých pauz či mezer mezi větami.

Vícejazyčná architektura

Jazykově specifické modely na CPU, nebo vícejazyčné na GPU

Odlehčené řečové modely pro CPU jsou primárně jazykově specifické, nikoli jeden vícejazyčný model. Pro AI agenty, kteří potřebují dynamicky měnit jazyk během téže interakce, podporuje Mihu několik strategií nasazení.

Efektivita CPU

Orchestrace modelů

Souběžně běží více jazykově specifických řečových modelů. Orchestrační vrstva Mihu detekuje nebo přijímá aktivní jazyk a dynamicky směruje zpracování řeči na odpovídající model.

Volbu modelu během interakce mohou řídit i systémová pravidla s vyšší prioritou.

Maximální vícejazyčná flexibilita

Vícejazyčné modely na GPU

Pro scénáře vyžadující vysoce dynamické vícejazyčné konverzace lze místo toho nasadit větší vícejazyčné řečové modely na GPU infrastruktuře.

Architektura je podle typu zátěže optimalizována buď na efektivitu CPU s jazykově specifickými modely, nebo na maximální vícejazyčnou flexibilitu s modely na GPU.

Poznámka: vícejazyčné STT i vícejazyčné TTS vyžadují GPU infrastrukturu. Čistě CPU cesta platí pro jazykově specifické modely Mihu STT a Mihu TTS.

Lokální LLM infrastruktura

Vrstva uvažování běží na open-weight modelech uvnitř vašeho prostředí.

Vrstva uvažování běží zcela uvnitř vašeho prostředí na open-weight LLM: na modelech, jejichž váhy jsou veřejně uvolněné a které mohou běžet plně offline na vašem vlastním hardwaru, bez připojení k dodavateli modelu. Mihu průběžně vyhodnocuje nové open-weight modely namísto trvalého navázání on-premise stacku na jedinou rodinu modelů.

Vysoce výkonná nasazení LLM obvykle vyžadují GPU infrastrukturu. Doporučený model se může měnit s tím, jak přicházejí nové modely, a Mihu může model pro uvažování aktualizovat nebo nahradit nezávisle na zbytku infrastruktury agentů.

Infrastruktura je nezávislá na modelu. Nejlepší dostupný model se může změnit; vaše architektura nemusí.

Doporučená konfigurace k datu nasazení

Model uvažování se vybírá v době nasazení z aktuální evaluační sady. K září 2026 je jednou z našich preferovaných výkonných konfigurací Kimi K2.6 Instant. Běží na dedikované GPU infrastruktuře poskytované nad rámec základu 128 vCPU. Tam, kde platí požadavky na způsob pořízení nebo původ modelu, lze zvolit open-weight alternativy od jiných dodavatelů a z jiných regionů, například Llama nebo Mistral. Výběr se potvrzuje v každé nabídce nasazení.

Infrastruktura Mihu Core

Z čeho se skládá kompletní nasazení

Plné nasazení Mihu On-Premise se skládá z několika nezávislých služeb. Všechny základní komponenty se dodávají jako kontejnerizované služby Docker a nasazují se na Kubernetes pomocí Rancher nebo Helm.

01

Mihu Core

Základní běhové prostředí AI agentů a byznysová logika.

02

Mihu Orchestration

Koordinuje řečové modely, LLM, agenty a běhové služby.

03

Mihu Relay

Vrstva komunikace v reálném čase mezi službami a relacemi agentů.

04

SIP infrastruktura

Zajišťuje podnikovou telefonii a SIP konektivitu.

05

Broadcast služby

Podporuje odchozí a objemově náročné komunikační zátěže.

06

Action Server

Vykonává nástroje, integrace a akce agentů.

07

Správcovská / webová aplikace

Rozhraní pro administraci, konfiguraci a provozní správu.

08

Databázová infrastruktura

Trvalé ukládání aplikačních a provozních dat.

09

Redis infrastruktura

Stav v reálném čase, cachování a distribuovaná koordinace běhu.

Volitelná infrastruktura

On-premise lze nasadit i další funkce Mihu. Tyto komponenty vyžadují podle využití dodatečnou serverovou kapacitu.

Mihu Builder

Pro generování a spouštění vlastních služeb, kódu, integrací a workflow. Provoz Builderu vyžaduje dodatečnou GPU kapacitu na serveru.

Mihu MCP Server

Pro zpřístupnění workspace Mihu a jeho funkcí AI systémům kompatibilním s MCP.

PBX Connector Server

Propojuje vaši stávající PBX nebo telefonní systém s SIP infrastrukturou Mihu pro příchozí i odchozí hovory.

SMTP server

Vyžadován, pokud chcete připojit e-mailový kanál. E-maily agentů a notifikace se odesílají přes váš vlastní SMTP server.

Observabilita a logování

Vyhrazená observabilita pro produkční nasazení

Produkční nasazení by měla zahrnovat vyhrazenou infrastrukturu pro observabilitu. Mihu doporučuje samostatnou infrastrukturu pro centrální logování a monitoring.

Centrální logování

Logy z Mihu Core, orchestrace, SIP, relay vrstvy, model serverů a aplikačních služeb jsou sbírány centrálně.

Monitoring

Metriky infrastruktury a aplikací jsou průběžně monitorovány. Při překročení předem definovaných provozních prahů lze generovat výstrahy.

Monitorované metriky
  • Využití CPU
  • Využití paměti
  • Využití GPU
  • Kapacita disku
  • Stav sítě
  • Stav služeb
  • Latence inference modelů
  • Hloubka fronty
  • Infrastruktura hovorů
  • Chyby aplikací
Síťová architektura

Není vyžadována žádná externí konektivita

Všechny služby Mihu běží na serverech uvnitř vlastní sítě zákazníka. Pro produkční provoz není vyžadována žádná VPN, tunel ani trvalé spojení s Mihu.

Interní AI služby nemusí být veřejně vystaveny. Telefonie se do SIP infrastruktury dostává přes stávající připojení zákazníka k operátorovi nebo PBX a síťová pravidla jsou plně definována infrastrukturními a bezpečnostními politikami zákazníka.

Síť zákazníka
Vstupní bodySIP trunk / PBXWebová aplikaceAPI
Core / Orchestration / SIP
STTLLMTTSAkce
DB / Cache / Úložiště
ProvozLogyNotifikaceMonitoring
Požadavky na infrastrukturu

Produkční základ

Pro produkční instalaci Mihu On-Premise se výchozí konfigurace infrastruktury určuje podle očekávané souběžnosti a zátěže.

Výpočetní výkon

128 vCPU
Doporučené minimum · základní služby a hlasová vrstva na CPU
+ GPU
Podle zvoleného modelu · např. Kimi K2.6 Instant, Qwen, Llama nebo Mistral; doporučený model se může v čase měnit

Základ 128 vCPU pokrývá služby Mihu Core a STT/TTS na CPU. Nepokrývá vrstvu uvažování: výkonný vlastní hostovaný LLM, jako je Kimi K2.6 Instant, vyžaduje nad rámec tohoto základu dedikovanou GPU infrastrukturu dimenzovanou podle zvoleného modelu a očekávané souběžnosti. Volba menšího open-weight modelu odpovídajícím způsobem snižuje nároky na GPU. GPU kapacita se přidává i tehdy, když jsou vyžadovány vícejazyčné hlasové modely na GPU. Přesné přidělení závisí na souběžných AI konverzacích, zátěži STT/TTS, nasazených jazycích, volbě LLM, konfiguraci redundance a doplňkových službách, jako jsou Builder a MCP.

Rozdělení mezi fyzická jádra a vCPU je potvrzeno v návrhu nasazení.

Úložiště

hovory × průměrná délka × formát nahrávky × doba uchování
Kapacita pro nahrávky

Požadavky na úložiště závisí především na tom, zda jsou nahrávky hovorů a další média uchovávány lokálně. Aplikační databáze Mihu vyžadují trvalé úložiště, zatímco kapacita pro nahrávky se počítá zvlášť. Zákazníci uchovávající nahrávky měsíce nebo roky by měli vyčlenit samostatný svazek úložiště dimenzovaný podle své politiky uchování.

Zákazníci si sami definují
  • dobu uchování nahrávek
  • dobu uchování přepisů
  • politiku zálohování
  • politiku archivace
  • politiku mazání

Vysoká dostupnost

99.9%
Cílová provozní dostupnost

Produkční architekturu lze nakonfigurovat s redundancí napříč kritickými službami Mihu. Dosažení tohoto cíle vyžaduje udržování dohodnuté produkční architektury, redundance a požadavků na infrastrukturu.

Pro podnikové on-premise instalace je přidělena vyhrazená provozní odpovědnost. Nedojde-li k výpadkům podkladové infrastruktury nebo hardwaru mimo provozní odpovědnost Mihu, je nasazení navrženo na dohodnutý cíl dostupnosti služby 99.9%. Odpovědnosti jednotlivých vrstev jsou vymezeny v dokumentu SLA.

Nasazení

Předkonfigurováno, v Dockeru, dodáno společně s vaším infrastrukturním týmem

Kompletní stack Mihu je poskytován jako předkonfigurované Docker služby. Inženýrský tým Mihu zajišťuje konfiguraci nasazení a připravenost na produkci společně s infrastrukturním týmem zákazníka. Typické on-premise nasazení je dodáno za 3–6 měsíců, od přípravy infrastruktury až po produkci, a je k dispozici podnikovým zákazníkům.

  1. Příprava infrastruktury
  2. Konfigurace sítě
  3. Služby Mihu
  4. Řečové modely
  5. LLM
  6. Telefonie
  7. Úložiště
  8. Observabilita
  9. Validace
  10. Produkce

Kubernetes: stack lze nasadit pomocí Helm chartů. Standardní a nejrychlejší cestou Mihu je nasazení Kubernetes spravované nástrojem Rancher.

Verzování a vydání

Mihu On-Premise používá verzování založené na větvích: každé zákaznické nasazení běží na vlastní release větvi a aktualizace jsou dodávány jako měsíční vydání. Každé vydání je před nasazením ověřeno a aplikováno v koordinaci s infrastrukturním týmem zákazníka, takže upgrady jsou plánované, nikoli vynucené. Validace vydání zahrnuje standardní sadu testů; některé jednotkové testy se mohou lišit v závislosti na zákaznických úpravách.

Vyhrazený tým podpory

Ke každému on-premise prostředí přiděluje Mihu tým customer success a tým DevOps, které spolupracují s vaším týmem. Podpora probíhá prostřednictvím sdílené skupiny na Slacku, takže provozní dotazy, koordinace vydání a incidenty se řeší přímo s lidmi, kteří vaše nasazení znají.

Vše zůstává uvnitř.

Jednostránkový přehled toho, co kde běží v nasazení Mihu On-Premise.

ŘečOn-premise
Mihu STTCPU
Mihu TTSCPU
Klonování hlasuPrivátní
LLMOpen weights / ve vlastní režii
Fine-tuningV infrastruktuře zákazníka
TelefonieSIP
DataPod kontrolou zákazníka
NahrávkyPod kontrolou zákazníka
DatabázeOn-premise
IntegraceAction Server on-premise
NasazeníV Dockeru · Kubernetes (Rancher / Helm)
KonektivitaUvnitř sítě zákazníka
ObservabilitaVyhrazená
Cíl SLA99.9%
Dodání3–6 měsíců do produkce
DostupnostPodnikoví zákazníci
PodporaTým customer success + DevOps, sdílená skupina na Slacku
VydáníMěsíční, verzování založené na větvích
FAQ

Mihu AI On-Premise — Často kladené otázky

Co přesně běží uvnitř naší infrastruktury?

Kompletní stack: Speech-to-Text, Text-to-Speech, klonování hlasu, LLM vrstva uvažování, orchestrace, SIP telefonie, Action Server pro integrace, správcovská aplikace a databázová a Redis vrstva. Data zákazníků nemusí opustit vaše prostředí.

Potřebujeme GPU?

Pro řečovou vrstvu ne. STT a TTS běží na CPU s modely o velikosti zhruba 66M až 143M parametrů. Vysoce výkonné open-weight LLM obvykle vyžadují GPU infrastrukturu a kapacita GPU se doplňuje také tehdy, zvolíte-li větší vícejazyčné řečové modely.

Jaké jazyky on-premise řečový stack podporuje?

Aktuální on-premise hlasový stack běžící na CPU podporuje sedm jazyků: angličtinu, němčinu, francouzštinu, španělštinu, italštinu, ruštinu a turečtinu. Tyto jazykově specifické modely Mihu STT a Mihu TTS běží na CPU, bez GPU. Mihu STT obvykle dosahuje přibližně 5–9 % chybovosti slov (WER); přesná hodnota závisí na jazyce a evaluační datové sadě.

Který LLM se používá a lze jej později změnit?

Vrstva uvažování je nezávislá na modelu a běží na open-weight modelech. Mihu doporučuje model k datu nasazení a pro splnění požadavků na způsob pořízení nebo původ modelu lze zvolit alternativy od jiných dodavatelů a z jiných regionů, například Llama nebo Mistral vedle Kimi K2.6 Instant. Model lze aktualizovat nebo nahradit nezávisle na zbytku infrastruktury agentů, jakmile budou k dispozici lepší open-weight modely.

Můžeme řečové modely doladit na vlastních datech?

Ano. Podporované STT a TTS modely lze doladit v infrastruktuře pod kontrolou zákazníka s využitím vašich vlastních datových sad, takže vlastní audio se nikdy nedostane k externímu poskytovateli. Výsledné modely zůstávají privátní pro vaši organizaci.

Jakou infrastrukturu potřebujeme na začátku?

Typický produkční základ začíná na 128 vCPU pro základní služby Mihu a hlasovou vrstvu na CPU. Vlastní hostovaný LLM se dimenzuje samostatně a vyžaduje nad rámec tohoto základu dedikovanou GPU infrastrukturu; GPU kapacita se přidává i pro vícejazyčné hlasové modely na GPU. Úložiště se dimenzuje podle vaší politiky uchovávání nahrávek a přepisů. Přesné dimenzování se potvrzuje v nabídce nasazení.

Jak je nasazení dodáno a připojeno?

Vše se dodává jako předkonfigurované služby Docker a běží na vlastních serverech zákazníka. Pro produkční provoz není vyžadována VPN ani zpětné spojení s Mihu a žádná interní AI služba nemusí být veřejně vystavena. Inženýrský tým Mihu zajišťuje konfiguraci nasazení společně s vaším infrastrukturním týmem.

Dokážete natrénovat STT a TTS pro jazyk mimo současných sedm?

Ano. Nové jazyky lze přidat na vyžádání. Náročnost trénování se liší podle jazykové skupiny a STT a TTS se trénují odděleně. Mihu může trénovací datovou sadu pro vás zajistit nebo zakoupit, případně pracovat s daty, která poskytnete. Trénování probíhá na strojích, které dodáte, nebo na infrastruktuře poskytnuté Mihu, a výsledné modely Mihu STT a Mihu TTS se poté nasadí do vašeho prostředí úplně stejně jako standardní modely.

Plánujete on-premise nasazení?

Sdělte nám očekávanou souběžnost, jazyky a požadavky na lokalitu uložení dat. Náš inženýrský tým se ozve s návrhem dimenzování a plánem nasazení.