# Implementare On-Premise — Mihu AI

Mihu AI On-Premise

# Agenții dumneavoastră. Modelele dumneavoastră. Vocile dumneavoastră. Infrastructura dumneavoastră. Datele dumneavoastră.

Mihu rulează întregul stack de agenți AI — de la voce și raționament până la telefonie și acțiuni — în interiorul infrastructurii dumneavoastră. Datele clienților nu trebuie să părăsească mediul dumneavoastră.

Discutați cu echipa de vânzări (https://mihu.ai/ro/contact) Cerințe de implementare (https://mihu.ai/ro/on-premise#requirements)

7

Limbi vocale on-premise

CPU

Inferență Mihu STT și TTS

99.9%

Țintă de disponibilitate

Limita implementării

În interiorul rețelei dumneavoastră

Telefonie

Infrastructură SIP, servicii de difuzare

Local

Voce

Mihu STT, Mihu TTS și clonare vocală pe CPU

Local

Raționament

LLM open-weight, găzduit intern

Local

Acțiuni

Action Server, integrări, fluxuri de lucru

Local

Date

Bază de date, Redis, înregistrări, transcrieri

Local

Livrat ca servicii Docker containerizate pe infrastructură gestionată de client, implementat pe Kubernetes cu Rancher sau Helm.

Prezentare generală

## Infrastructură vocală AI privată, implementată integral în mediul dumneavoastră.

Mihu AI On-Premise este o ofertă enterprise care permite organizațiilor să ruleze întregul stack de agenți Mihu AI în propria infrastructură.

Procesarea vocală, inferența AI, orchestrarea, telefonia, integrările, serviciile aplicative și stocarea datelor pot funcționa fără ca datele clienților să părăsească mediul organizației.

Întreaga implementare este livrată ca servicii Docker containerizate și rulează pe infrastructură gestionată de client, implementată pe Kubernetes cu Rancher sau Helm.

Voce

On-premise, inferență pe CPU

LLM

Open-weight, găzduit intern

Telefonie

SIP în interiorul rețelei dumneavoastră

Date

Stocare controlată de client

Infrastructură vocală

## Mihu STT și Mihu TTS, complet on-premise.

Mihu oferă propriile modele vocale — Mihu STT (Speech-to-Text) și Mihu TTS (Text-to-Speech) — complet on-premise. Pentru implementările acceptate:

Mihu STT (Speech-to-Text) rulează local.

Mihu TTS (Text-to-Speech) rulează local.

Inferența exclusiv pe CPU este acceptată pentru stratul vocal.

Nu este necesar niciun API vocal extern.

Clonarea vocală poate fi implementată în infrastructura clientului.

Fișierele audio și datele de antrenare ale clientului pot rămâne integral în mediul clientului.

Stack-ul vocal on-premise actual · 7 limbi

Engleză Germană Franceză Spaniolă Italiană Rusă Turcă

Aceste 7 limbi rulează integral pe modelele STT și TTS proprii Mihu, în interiorul infrastructurii dvs. Platforma cloud Mihu acceptă peste 40 de limbi prin modele vocale suplimentare.

5–9%

Rata tipică de eroare a cuvintelor (WER) a implementărilor Mihu STT (Speech-to-Text) actuale, în funcție de limbă și de setul de date utilizat la evaluare.

### Modele vocale ușoare pentru CPU

Infrastructura vocală Mihu este proiectată pentru a menține reduse cerințele de inferență. În funcție de limbă și de configurația modelului, modelele vocale implementate au aproximativ 66M – 143M de parametri.

Acest lucru face posibilă rularea sarcinilor STT și TTS pe infrastructură CPU, fără a necesita GPU dedicate pentru fiecare sarcină vocală.

Capacitatea reală depinde de

conversații simultane

limba selectată

modelul STT/TTS selectat

configurația audio

ținta de latență

cerințele de redundanță

Cifrele privind concurența sunt stabilite pentru fiecare implementare prin teste de performanță pe hardware-ul țintă, nu sunt indicate ca raport fix între CPU și apeluri.

Personalizare

## Fine-tuning privat și clonare vocală

Datele vocale proprietare și vocile de brand rămân pe infrastructura pe care o controlați.

### Fine-tuning privat

Organizațiile care dețin date vocale proprietare de calitate ridicată pot personaliza suplimentar stratul vocal. Mihu poate realiza fine-tuning al modelelor STT/TTS acceptate direct pe infrastructura controlată de client, astfel încât seturile de date proprietare să nu fie transferate către un furnizor terț de inferență.

Modelele personalizate pot fi

ajustate folosind seturi de date furnizate de client

optimizate pentru terminologia specifică industriei

adaptate pentru accente și vorbire specifică domeniului

implementate exclusiv în infrastructura clientului

păstrate private, integral în propria dvs. infrastructură

Deosebit de util pentru organizațiile cu vocabular specializat, accente regionale sau cerințe stricte privind rezidența datelor.

### Clonare vocală

Mihu On-Premise acceptă și clonarea vocală privată. Mostrele vocale furnizate pot fi utilizate pentru a crea voci specifice organizației, care sunt apoi găzduite în propria infrastructură a clientului.

Atât înregistrările sursă, cât și modelul vocal rezultat pot rămâne private.

Acest lucru permite companiilor să creeze voci de brand consecvente, fără a depinde de un furnizor TTS extern în timpul inferenței de producție.

Cerință pentru mostra vocală: aproximativ 30 de secunde de vorbire clară, înregistrată fără pauze lungi sau goluri între propoziții.

Arhitectură multilingvă

## Specifice pe limbă, pe CPU, sau multilingve, pe GPU

Modelele vocale ușoare pentru CPU sunt în principal specifice fiecărei limbi, nu un singur model multilingv. Pentru agenții AI care trebuie să schimbe limba dinamic în cadrul aceleiași interacțiuni, Mihu acceptă mai multe strategii de implementare.

Eficiență CPU

### Orchestrarea modelelor

Mai multe modele vocale specifice fiecărei limbi rulează simultan. Stratul de orchestrare Mihu detectează sau primește limba activă și direcționează dinamic procesarea vocală către modelul potrivit.

Selecția modelului poate fi controlată și prin suprascrieri la nivel de sistem în timpul unei interacțiuni.

Flexibilitate multilingvă maximă

### Modele multilingve pe GPU

Pentru scenariile care necesită conversații multilingve foarte dinamice, pot fi implementate în schimb modele vocale multilingve mai mari, pe infrastructură GPU.

Arhitectura este optimizată fie pentru eficiență pe CPU cu modele specifice fiecărei limbi, fie pentru flexibilitate multilingvă maximă cu modele bazate pe GPU, în funcție de volumul de lucru.

Notă: atât STT multilingv, cât și TTS multilingv necesită infrastructură GPU. Calea vocală exclusiv pe CPU se aplică modelelor Mihu STT și Mihu TTS specifice fiecărei limbi.

Infrastructură LLM locală

## Stratul de raționament rulează pe modele open-weight, în mediul dumneavoastră.

Stratul de raționament rulează integral în mediul dumneavoastră, folosind LLM open-weight: modele ale căror ponderi sunt disponibile public și care pot rula complet offline, pe propriul hardware, fără nicio conexiune către furnizorul modelului. Mihu evaluează continuu noile modele open-weight, în loc să lege permanent stack-ul on-premise de o singură familie de modele.

Implementările LLM de înaltă performanță necesită în general infrastructură GPU. Modelul recomandat se poate schimba pe măsură ce apar modele noi, iar Mihu poate actualiza sau înlocui modelul de raționament independent de restul infrastructurii de agenți.

Infrastructura este independentă de model. Cel mai bun model disponibil se poate schimba; arhitectura dumneavoastră nu trebuie să se schimbe.

Configurație recomandată la data implementării

Modelul de raționament este selectat la momentul implementării din setul de evaluare curent. La septembrie 2026, una dintre configurațiile noastre performante preferate este Kimi K2.6 Instant. Acesta rulează pe infrastructură GPU dedicată, provizionată suplimentar față de baza de 128 vCPU. Acolo unde există cerințe de achiziție sau privind originea modelului, pot fi selectate alternative open-weight de la alți furnizori și din alte regiuni, precum Llama sau Mistral. Selecția este confirmată în fiecare propunere de implementare.

Infrastructura Mihu Core

## Din ce este alcătuită o implementare completă

O implementare completă Mihu On-Premise constă din mai multe servicii independente. Toate componentele de bază sunt livrate ca servicii Docker containerizate și implementate pe Kubernetes cu Rancher sau Helm.

01

### Mihu Core

Runtime-ul principal al agenților AI și logica de business.

02

### Mihu Orchestration

Coordonează modelele vocale, LLM-urile, agenții și serviciile de runtime.

03

### Mihu Relay

Strat de comunicare în timp real între servicii și sesiunile agenților.

04

### Infrastructură SIP

Gestionează telefonia de tip enterprise și conectivitatea SIP.

05

### Servicii de difuzare

Susține sarcinile de comunicare outbound și de volum ridicat.

06

### Action Server

Execută instrumente, integrări și acțiuni ale agenților.

07

### Aplicație de management / web

Interfață de administrare, configurare și management operațional.

08

### Infrastructură de baze de date

Stocare persistentă a datelor aplicative și operaționale.

09

### Infrastructură Redis

Stare în timp real, cache și coordonare distribuită a runtime-ului.

### Infrastructură opțională

Și alte capabilități Mihu pot fi implementate on-premise. Aceste componente necesită capacitate suplimentară de server, în funcție de utilizare.

### Mihu Builder

Pentru generarea și rularea de servicii, cod, integrări și fluxuri de lucru personalizate. Rularea Builder necesită capacitate GPU suplimentară pe server.

### Mihu MCP Server

Pentru expunerea spațiului de lucru și a capabilităților Mihu către sisteme AI compatibile MCP.

### PBX Connector Server

Conectează PBX-ul sau sistemul de telefonie existent la infrastructura SIP Mihu pentru apeluri de intrare și de ieșire.

### Server SMTP

Necesar dacă doriți să conectați canalul de e-mail. E-mailurile agenților și notificările sunt trimise prin propriul dvs. server SMTP.

Observabilitate și jurnalizare

## Observabilitate dedicată pentru implementările de producție

Implementările de producție ar trebui să includă infrastructură dedicată de observabilitate. Mihu recomandă infrastructură separată pentru jurnalizare și monitorizare centralizate.

### Jurnalizare centralizată

Jurnalele de la Mihu Core, orchestrare, SIP, relay, serverele de modele și serviciile aplicative sunt colectate central.

### Monitorizare

Metricile de infrastructură și de aplicație sunt monitorizate continuu. Pot fi generate alerte atunci când sunt depășite pragurile operaționale predefinite.

Metrici monitorizate

Utilizarea CPU

Utilizarea memoriei

Utilizarea GPU

Capacitatea de stocare

Starea rețelei

Starea serviciilor

Latența inferenței modelelor

Dimensiunea cozii

Infrastructura de apeluri

Erori ale aplicației

Arhitectură de rețea

## Nu este necesară conectivitate externă

Toate serviciile Mihu rulează pe servere din rețeaua proprie a clientului. Pentru operarea în producție nu este necesar VPN, tunel sau conexiune permanentă către Mihu.

Serviciile AI interne nu necesită expunere publică. Telefonia ajunge la infrastructura SIP prin conectivitatea existentă a clientului cu operatorul sau PBX-ul, iar regulile de rețea sunt definite integral de politicile de infrastructură și securitate ale clientului.

Rețeaua clientului

Puncte de intrare SIP trunk / PBX Aplicație web API

Core / Orchestration / SIP

STT LLM TTS Acțiuni

DB / Cache / Stocare

Operațiuni Loguri Notificări Monitorizare

Cerințe de infrastructură

## Configurație de bază pentru producție

Pentru o instalare Mihu On-Premise în producție, configurația inițială a infrastructurii este stabilită în funcție de concurența și de volumele de lucru estimate.

### Resurse de calcul

128 vCPU

Minim recomandat · servicii de bază și stratul vocal pe CPU

+ GPU

În funcție de modelul selectat · ex. Kimi K2.6 Instant, Qwen, Llama sau Mistral; modelul recomandat se poate schimba în timp

Baza de 128 vCPU acoperă serviciile Mihu Core și STT/TTS pe CPU. Nu acoperă stratul de raționament: un LLM performant găzduit intern, precum Kimi K2.6 Instant, necesită infrastructură GPU dedicată peste această bază, dimensionată în funcție de modelul selectat și de concurența estimată. Alegerea unui model open-weight mai mic reduce corespunzător necesarul de GPU. Capacitatea GPU este adăugată și atunci când sunt necesare modele vocale multilingve pe GPU. Alocarea exactă depinde de conversațiile AI simultane, de sarcina STT/TTS, de limbile implementate, de alegerea LLM-ului, de configurația de redundanță și de serviciile suplimentare precum Builder și MCP.

Alocarea de nuclee fizice față de vCPU este confirmată în propunerea de implementare.

### Stocare

apeluri × durată medie × format de înregistrare × perioadă de retenție

Capacitate pentru înregistrări

Cerințele de stocare depind în principal de păstrarea locală a înregistrărilor apelurilor și a altor fișiere media. Bazele de date ale aplicației Mihu necesită stocare persistentă, în timp ce capacitatea pentru înregistrări este calculată separat. Clienții care păstrează înregistrări timp de luni sau ani ar trebui să prevadă un volum de stocare dedicat, dimensionat conform politicii lor de retenție.

Clienții își definesc propriile

retenție a înregistrărilor

retenție a transcrierilor

politică de backup

politică de arhivare

politică de ștergere

### Disponibilitate ridicată

99.9%

Țintă de disponibilitate operațională

Arhitectura de producție poate fi configurată cu redundanță pentru serviciile Mihu critice. Atingerea acestei ținte presupune menținerea arhitecturii de producție agreate, a redundanței și a cerințelor de infrastructură.

Pentru instalările on-premise de tip enterprise este alocată o responsabilitate operațională dedicată. În absența unor defecțiuni ale infrastructurii sau hardware-ului aflate în afara responsabilității operaționale a Mihu, implementarea este proiectată pentru atingerea țintei agreate de disponibilitate a serviciului de 99,9%. Responsabilitățile pe fiecare strat sunt definite în documentul SLA.

Implementare

## Preconfigurat, containerizat cu Docker, livrat împreună cu echipa dumneavoastră de infrastructură

Întregul stack Mihu este furnizat ca servicii Docker preconfigurate. Echipa de inginerie Mihu se ocupă de configurarea implementării și de pregătirea pentru producție împreună cu echipa de infrastructură a clientului. O implementare on-premise tipică este livrată în 3–6 luni, de la pregătirea infrastructurii până la producție, și este disponibilă clienților enterprise.

Pregătirea infrastructurii

Configurarea rețelei

Servicii Mihu

Modele vocale

LLM

Telefonie

Stocare

Observabilitate

Validare

Producție

Kubernetes: stack-ul poate fi implementat cu chart-uri Helm. Calea standard și cea mai rapidă recomandată de Mihu este o implementare Kubernetes administrată cu Rancher.

### Versionare și release-uri

Mihu On-Premise folosește versionare bazată pe ramuri: fiecare implementare de client rulează pe propria ramură de release, iar actualizările sunt livrate ca release-uri lunare. Fiecare release este validat înainte de lansare și aplicat în coordonare cu echipa de infrastructură a clientului, astfel încât actualizările sunt programate, nu impuse. Validarea release-ului acoperă suita standard de teste; unele teste unitare pot diferi în funcție de personalizările specifice fiecărui client.

### Echipă de suport dedicată

Pentru fiecare mediu on-premise, Mihu alocă o echipă de customer success și o echipă DevOps care lucrează alături de echipa dumneavoastră. Suportul se desfășoară printr-un grup Slack comun, astfel încât întrebările operaționale, coordonarea release-urilor și incidentele sunt tratate direct cu oamenii care cunosc implementarea dumneavoastră.

## Totul rămâne în interior.

O imagine de ansamblu, pe o singură pagină, a ceea ce rulează și unde într-o implementare Mihu On-Premise.

Voce On-premise

Mihu STT CPU

Mihu TTS CPU

Clonare vocală Privată

LLM Open-weight / găzduit intern

Fine-tuning Pe infrastructura clientului

Telefonie SIP

Date Controlate de client

Înregistrări Controlate de client

Bază de date On-premise

Integrări Action Server on-premise

Implementare Containerizată cu Docker · Kubernetes (Rancher / Helm)

Conectivitate În interiorul rețelei clientului

Observabilitate Dedicată

Țintă SLA 99.9%

Livrare 3–6 luni până în producție

Disponibilitate Clienți enterprise

Suport Echipă de customer success + DevOps, grup Slack comun

Release-uri Lunare, versionare bazată pe ramuri

Întrebări frecvente

## Mihu AI On-Premise — Întrebări frecvente

Ce rulează efectiv în infrastructura noastră?

Întregul stack: Speech-to-Text, Text-to-Speech, clonarea vocală, stratul de raționament LLM, orchestrarea, telefonia SIP, Action Server pentru integrări, aplicația de management, precum și straturile de bază de date și Redis. Datele clienților nu trebuie să părăsească mediul dumneavoastră.

Avem nevoie de GPU?

Nu pentru stratul vocal. STT și TTS rulează pe CPU, cu modele de aproximativ 66M până la 143M de parametri. LLM-urile open-weight de înaltă performanță necesită în general infrastructură GPU, iar capacitatea GPU este adăugată și dacă optați pentru modele vocale multilingve mai mari.

Ce limbi acceptă stack-ul vocal on-premise?

Stiva vocală on-premise actuală, pe CPU, acceptă șapte limbi: engleză, germană, franceză, spaniolă, italiană, rusă și turcă. Aceste modele Mihu STT și Mihu TTS specifice fiecărei limbi rulează pe CPU, fără GPU. Mihu STT atinge de obicei o rată de eroare a cuvintelor (WER) de aproximativ 5–9%; valoarea exactă depinde de limbă și de setul de date de evaluare.

Ce LLM este utilizat și poate fi schimbat ulterior?

Stratul de raționament este independent de model și rulează modele open-weight. Mihu recomandă un model la data implementării, iar pentru a răspunde cerințelor de achiziție sau privind originea modelului pot fi selectate alternative de la alți furnizori și din alte regiuni, de exemplu Llama sau Mistral pe lângă Kimi K2.6 Instant. Modelul poate fi actualizat sau înlocuit independent de restul infrastructurii de agenți, pe măsură ce devin disponibile modele open-weight mai bune.

Putem realiza fine-tuning al modelelor vocale pe propriile noastre date?

Da. Modelele STT și TTS acceptate pot fi ajustate pe infrastructură controlată de client, folosind propriile dumneavoastră seturi de date, astfel încât fișierele audio proprietare să nu ajungă niciodată la un furnizor terț. Modelele rezultate rămân private pentru organizația dumneavoastră.

De ce infrastructură avem nevoie pentru a începe?

O bază de producție tipică începe de la 128 vCPU pentru serviciile de bază Mihu și stratul vocal pe CPU. LLM-ul găzduit local este dimensionat separat și necesită infrastructură GPU dedicată peste această bază; capacitatea GPU este adăugată și pentru modelele vocale multilingve pe GPU. Stocarea este dimensionată conform politicii dvs. de păstrare a înregistrărilor și transcrierilor. Dimensionarea exactă este confirmată în propunerea de implementare.

Cum este livrată și conectată implementarea?

Totul este livrat ca servicii Docker preconfigurate și rulează pe serverele proprii ale clientului. Pentru operarea în producție nu este necesar VPN sau conexiune de retur către Mihu, iar niciun serviciu AI intern nu necesită expunere publică. Echipa de inginerie Mihu gestionează configurarea implementării împreună cu echipa dvs. de infrastructură.

Puteți antrena STT și TTS pentru o limbă din afara celor șapte actuale?

Da. Limbi noi pot fi adăugate la cerere. Efortul de antrenare diferă în funcție de grupul lingvistic, iar STT și TTS sunt antrenate separat. Mihu poate furniza sau achiziționa setul de date de antrenare pentru dvs. sau poate lucra cu datele pe care le furnizați. Antrenarea rulează pe mașini furnizate de dvs. sau pe infrastructură pusă la dispoziție de Mihu, iar modelele Mihu STT și Mihu TTS rezultate sunt apoi implementate în mediul dvs. exact ca cele standard.

## Planificați o implementare on-premise?

Comunicați-ne concurența estimată, limbile și cerințele privind rezidența datelor. Echipa noastră de inginerie vă va reveni cu o propunere de dimensionare și un plan de implementare.

Discutați cu echipa de vânzări (https://mihu.ai/ro/contact)
