Mihu rulează întregul stack de agenți AI — de la voce și raționament până la telefonie și acțiuni — în interiorul infrastructurii dumneavoastră. Datele clienților nu trebuie să părăsească mediul dumneavoastră.
Mihu AI On-Premise este o ofertă enterprise care permite organizațiilor să ruleze întregul stack de agenți Mihu AI în propria infrastructură.
Procesarea vocală, inferența AI, orchestrarea, telefonia, integrările, serviciile aplicative și stocarea datelor pot funcționa fără ca datele clienților să părăsească mediul organizației.
Întreaga implementare este livrată ca servicii Docker containerizate și rulează pe infrastructură gestionată de client, implementată pe Kubernetes cu Rancher sau Helm.
Mihu oferă propriile modele vocale — Mihu STT (Speech-to-Text) și Mihu TTS (Text-to-Speech) — complet on-premise. Pentru implementările acceptate:
Aceste 7 limbi rulează integral pe modelele STT și TTS proprii Mihu, în interiorul infrastructurii dvs. Platforma cloud Mihu acceptă peste 40 de limbi prin modele vocale suplimentare.
Infrastructura vocală Mihu este proiectată pentru a menține reduse cerințele de inferență. În funcție de limbă și de configurația modelului, modelele vocale implementate au aproximativ 66M – 143M de parametri.
Acest lucru face posibilă rularea sarcinilor STT și TTS pe infrastructură CPU, fără a necesita GPU dedicate pentru fiecare sarcină vocală.
Cifrele privind concurența sunt stabilite pentru fiecare implementare prin teste de performanță pe hardware-ul țintă, nu sunt indicate ca raport fix între CPU și apeluri.
Datele vocale proprietare și vocile de brand rămân pe infrastructura pe care o controlați.
Organizațiile care dețin date vocale proprietare de calitate ridicată pot personaliza suplimentar stratul vocal. Mihu poate realiza fine-tuning al modelelor STT/TTS acceptate direct pe infrastructura controlată de client, astfel încât seturile de date proprietare să nu fie transferate către un furnizor terț de inferență.
Deosebit de util pentru organizațiile cu vocabular specializat, accente regionale sau cerințe stricte privind rezidența datelor.
Mihu On-Premise acceptă și clonarea vocală privată. Mostrele vocale furnizate pot fi utilizate pentru a crea voci specifice organizației, care sunt apoi găzduite în propria infrastructură a clientului.
Atât înregistrările sursă, cât și modelul vocal rezultat pot rămâne private.
Acest lucru permite companiilor să creeze voci de brand consecvente, fără a depinde de un furnizor TTS extern în timpul inferenței de producție.
Cerință pentru mostra vocală: aproximativ 30 de secunde de vorbire clară, înregistrată fără pauze lungi sau goluri între propoziții.
Modelele vocale ușoare pentru CPU sunt în principal specifice fiecărei limbi, nu un singur model multilingv. Pentru agenții AI care trebuie să schimbe limba dinamic în cadrul aceleiași interacțiuni, Mihu acceptă mai multe strategii de implementare.
Mai multe modele vocale specifice fiecărei limbi rulează simultan. Stratul de orchestrare Mihu detectează sau primește limba activă și direcționează dinamic procesarea vocală către modelul potrivit.
Selecția modelului poate fi controlată și prin suprascrieri la nivel de sistem în timpul unei interacțiuni.
Pentru scenariile care necesită conversații multilingve foarte dinamice, pot fi implementate în schimb modele vocale multilingve mai mari, pe infrastructură GPU.
Arhitectura este optimizată fie pentru eficiență pe CPU cu modele specifice fiecărei limbi, fie pentru flexibilitate multilingvă maximă cu modele bazate pe GPU, în funcție de volumul de lucru.
Notă: atât STT multilingv, cât și TTS multilingv necesită infrastructură GPU. Calea vocală exclusiv pe CPU se aplică modelelor Mihu STT și Mihu TTS specifice fiecărei limbi.
Stratul de raționament rulează integral în mediul dumneavoastră, folosind LLM open-weight: modele ale căror ponderi sunt disponibile public și care pot rula complet offline, pe propriul hardware, fără nicio conexiune către furnizorul modelului. Mihu evaluează continuu noile modele open-weight, în loc să lege permanent stack-ul on-premise de o singură familie de modele.
Implementările LLM de înaltă performanță necesită în general infrastructură GPU. Modelul recomandat se poate schimba pe măsură ce apar modele noi, iar Mihu poate actualiza sau înlocui modelul de raționament independent de restul infrastructurii de agenți.
Infrastructura este independentă de model. Cel mai bun model disponibil se poate schimba; arhitectura dumneavoastră nu trebuie să se schimbe.
Modelul de raționament este selectat la momentul implementării din setul de evaluare curent. La septembrie 2026, una dintre configurațiile noastre performante preferate este Kimi K2.6 Instant. Acesta rulează pe infrastructură GPU dedicată, provizionată suplimentar față de baza de 128 vCPU. Acolo unde există cerințe de achiziție sau privind originea modelului, pot fi selectate alternative open-weight de la alți furnizori și din alte regiuni, precum Llama sau Mistral. Selecția este confirmată în fiecare propunere de implementare.
O implementare completă Mihu On-Premise constă din mai multe servicii independente. Toate componentele de bază sunt livrate ca servicii Docker containerizate și implementate pe Kubernetes cu Rancher sau Helm.
Runtime-ul principal al agenților AI și logica de business.
Coordonează modelele vocale, LLM-urile, agenții și serviciile de runtime.
Strat de comunicare în timp real între servicii și sesiunile agenților.
Gestionează telefonia de tip enterprise și conectivitatea SIP.
Susține sarcinile de comunicare outbound și de volum ridicat.
Execută instrumente, integrări și acțiuni ale agenților.
Interfață de administrare, configurare și management operațional.
Stocare persistentă a datelor aplicative și operaționale.
Stare în timp real, cache și coordonare distribuită a runtime-ului.
Și alte capabilități Mihu pot fi implementate on-premise. Aceste componente necesită capacitate suplimentară de server, în funcție de utilizare.
Pentru generarea și rularea de servicii, cod, integrări și fluxuri de lucru personalizate. Rularea Builder necesită capacitate GPU suplimentară pe server.
Pentru expunerea spațiului de lucru și a capabilităților Mihu către sisteme AI compatibile MCP.
Conectează PBX-ul sau sistemul de telefonie existent la infrastructura SIP Mihu pentru apeluri de intrare și de ieșire.
Necesar dacă doriți să conectați canalul de e-mail. E-mailurile agenților și notificările sunt trimise prin propriul dvs. server SMTP.
Implementările de producție ar trebui să includă infrastructură dedicată de observabilitate. Mihu recomandă infrastructură separată pentru jurnalizare și monitorizare centralizate.
Jurnalele de la Mihu Core, orchestrare, SIP, relay, serverele de modele și serviciile aplicative sunt colectate central.
Metricile de infrastructură și de aplicație sunt monitorizate continuu. Pot fi generate alerte atunci când sunt depășite pragurile operaționale predefinite.
Toate serviciile Mihu rulează pe servere din rețeaua proprie a clientului. Pentru operarea în producție nu este necesar VPN, tunel sau conexiune permanentă către Mihu.
Serviciile AI interne nu necesită expunere publică. Telefonia ajunge la infrastructura SIP prin conectivitatea existentă a clientului cu operatorul sau PBX-ul, iar regulile de rețea sunt definite integral de politicile de infrastructură și securitate ale clientului.
Pentru o instalare Mihu On-Premise în producție, configurația inițială a infrastructurii este stabilită în funcție de concurența și de volumele de lucru estimate.
Baza de 128 vCPU acoperă serviciile Mihu Core și STT/TTS pe CPU. Nu acoperă stratul de raționament: un LLM performant găzduit intern, precum Kimi K2.6 Instant, necesită infrastructură GPU dedicată peste această bază, dimensionată în funcție de modelul selectat și de concurența estimată. Alegerea unui model open-weight mai mic reduce corespunzător necesarul de GPU. Capacitatea GPU este adăugată și atunci când sunt necesare modele vocale multilingve pe GPU. Alocarea exactă depinde de conversațiile AI simultane, de sarcina STT/TTS, de limbile implementate, de alegerea LLM-ului, de configurația de redundanță și de serviciile suplimentare precum Builder și MCP.
Alocarea de nuclee fizice față de vCPU este confirmată în propunerea de implementare.
Cerințele de stocare depind în principal de păstrarea locală a înregistrărilor apelurilor și a altor fișiere media. Bazele de date ale aplicației Mihu necesită stocare persistentă, în timp ce capacitatea pentru înregistrări este calculată separat. Clienții care păstrează înregistrări timp de luni sau ani ar trebui să prevadă un volum de stocare dedicat, dimensionat conform politicii lor de retenție.
Arhitectura de producție poate fi configurată cu redundanță pentru serviciile Mihu critice. Atingerea acestei ținte presupune menținerea arhitecturii de producție agreate, a redundanței și a cerințelor de infrastructură.
Pentru instalările on-premise de tip enterprise este alocată o responsabilitate operațională dedicată. În absența unor defecțiuni ale infrastructurii sau hardware-ului aflate în afara responsabilității operaționale a Mihu, implementarea este proiectată pentru atingerea țintei agreate de disponibilitate a serviciului de 99,9%. Responsabilitățile pe fiecare strat sunt definite în documentul SLA.
Întregul stack Mihu este furnizat ca servicii Docker preconfigurate. Echipa de inginerie Mihu se ocupă de configurarea implementării și de pregătirea pentru producție împreună cu echipa de infrastructură a clientului. O implementare on-premise tipică este livrată în 3–6 luni, de la pregătirea infrastructurii până la producție, și este disponibilă clienților enterprise.
Kubernetes: stack-ul poate fi implementat cu chart-uri Helm. Calea standard și cea mai rapidă recomandată de Mihu este o implementare Kubernetes administrată cu Rancher.
Mihu On-Premise folosește versionare bazată pe ramuri: fiecare implementare de client rulează pe propria ramură de release, iar actualizările sunt livrate ca release-uri lunare. Fiecare release este validat înainte de lansare și aplicat în coordonare cu echipa de infrastructură a clientului, astfel încât actualizările sunt programate, nu impuse. Validarea release-ului acoperă suita standard de teste; unele teste unitare pot diferi în funcție de personalizările specifice fiecărui client.
Pentru fiecare mediu on-premise, Mihu alocă o echipă de customer success și o echipă DevOps care lucrează alături de echipa dumneavoastră. Suportul se desfășoară printr-un grup Slack comun, astfel încât întrebările operaționale, coordonarea release-urilor și incidentele sunt tratate direct cu oamenii care cunosc implementarea dumneavoastră.
O imagine de ansamblu, pe o singură pagină, a ceea ce rulează și unde într-o implementare Mihu On-Premise.
Întregul stack: Speech-to-Text, Text-to-Speech, clonarea vocală, stratul de raționament LLM, orchestrarea, telefonia SIP, Action Server pentru integrări, aplicația de management, precum și straturile de bază de date și Redis. Datele clienților nu trebuie să părăsească mediul dumneavoastră.
Nu pentru stratul vocal. STT și TTS rulează pe CPU, cu modele de aproximativ 66M până la 143M de parametri. LLM-urile open-weight de înaltă performanță necesită în general infrastructură GPU, iar capacitatea GPU este adăugată și dacă optați pentru modele vocale multilingve mai mari.
Stiva vocală on-premise actuală, pe CPU, acceptă șapte limbi: engleză, germană, franceză, spaniolă, italiană, rusă și turcă. Aceste modele Mihu STT și Mihu TTS specifice fiecărei limbi rulează pe CPU, fără GPU. Mihu STT atinge de obicei o rată de eroare a cuvintelor (WER) de aproximativ 5–9%; valoarea exactă depinde de limbă și de setul de date de evaluare.
Stratul de raționament este independent de model și rulează modele open-weight. Mihu recomandă un model la data implementării, iar pentru a răspunde cerințelor de achiziție sau privind originea modelului pot fi selectate alternative de la alți furnizori și din alte regiuni, de exemplu Llama sau Mistral pe lângă Kimi K2.6 Instant. Modelul poate fi actualizat sau înlocuit independent de restul infrastructurii de agenți, pe măsură ce devin disponibile modele open-weight mai bune.
Da. Modelele STT și TTS acceptate pot fi ajustate pe infrastructură controlată de client, folosind propriile dumneavoastră seturi de date, astfel încât fișierele audio proprietare să nu ajungă niciodată la un furnizor terț. Modelele rezultate rămân private pentru organizația dumneavoastră.
O bază de producție tipică începe de la 128 vCPU pentru serviciile de bază Mihu și stratul vocal pe CPU. LLM-ul găzduit local este dimensionat separat și necesită infrastructură GPU dedicată peste această bază; capacitatea GPU este adăugată și pentru modelele vocale multilingve pe GPU. Stocarea este dimensionată conform politicii dvs. de păstrare a înregistrărilor și transcrierilor. Dimensionarea exactă este confirmată în propunerea de implementare.
Totul este livrat ca servicii Docker preconfigurate și rulează pe serverele proprii ale clientului. Pentru operarea în producție nu este necesar VPN sau conexiune de retur către Mihu, iar niciun serviciu AI intern nu necesită expunere publică. Echipa de inginerie Mihu gestionează configurarea implementării împreună cu echipa dvs. de infrastructură.
Da. Limbi noi pot fi adăugate la cerere. Efortul de antrenare diferă în funcție de grupul lingvistic, iar STT și TTS sunt antrenate separat. Mihu poate furniza sau achiziționa setul de date de antrenare pentru dvs. sau poate lucra cu datele pe care le furnizați. Antrenarea rulează pe mașini furnizate de dvs. sau pe infrastructură pusă la dispoziție de Mihu, iar modelele Mihu STT și Mihu TTS rezultate sunt apoi implementate în mediul dvs. exact ca cele standard.
Comunicați-ne concurența estimată, limbile și cerințele privind rezidența datelor. Echipa noastră de inginerie vă va reveni cu o propunere de dimensionare și un plan de implementare.