# On-Premise implementatie — Mihu AI

Mihu AI On-Premise

# Uw agenten. Uw modellen. Uw stemmen. Uw infrastructuur. Uw data.

Mihu draait de volledige AI-agentstack — van spraak en redeneren tot telefonie en acties — binnen uw infrastructuur. Klantgegevens hoeven uw omgeving niet te verlaten.

Neem contact op met Sales (https://mihu.ai/nl/contact) Implementatievereisten (https://mihu.ai/nl/on-premise#requirements)

7

On-premise spraaktalen

CPU

Mihu STT & TTS-inferentie

99.9%

Beschikbaarheidsdoel

Implementatiegrens

Binnen uw netwerk

Telefonie

SIP-infrastructuur, broadcastdiensten

Lokaal

Spraak

Mihu STT, Mihu TTS en voice cloning op CPU

Lokaal

Redeneren

Open-weight LLM, zelfgehost

Lokaal

Acties

Action Server, integraties, workflows

Lokaal

Data

Database, Redis, opnames, transcripties

Lokaal

Geleverd als gecontaineriseerde Docker-services op door de klant beheerde infrastructuur, uitgerold op Kubernetes met Rancher of Helm.

Overzicht

## Private AI-spraakinfrastructuur, volledig binnen uw eigen omgeving geïmplementeerd.

Mihu AI On-Premise is een enterpriseaanbod waarmee organisaties de volledige Mihu AI-agentstack binnen hun eigen infrastructuur kunnen draaien.

Spraakverwerking, AI-inferentie, orkestratie, telefonie, integraties, applicatiediensten en dataopslag kunnen functioneren zonder dat klantgegevens de omgeving van de organisatie verlaten.

De volledige implementatie wordt geleverd als gecontaineriseerde Docker-services en draait op door de klant beheerde infrastructuur, uitgerold op Kubernetes met Rancher of Helm.

Spraak

On-premise, CPU-inferentie

LLM

Open weights, zelfgehost

Telefonie

SIP binnen uw netwerk

Data

Opslag onder controle van de klant

Spraakinfrastructuur

## Mihu STT & Mihu TTS, volledig on-premise.

Mihu levert zijn eigen spraakmodellen — Mihu STT (Speech-to-Text) en Mihu TTS (Text-to-Speech) — volledig on-premise. Voor ondersteunde implementaties:

Mihu STT (Speech-to-Text) draait lokaal.

Mihu TTS (Text-to-Speech) draait lokaal.

Voor de spraaklaag wordt inferentie op uitsluitend CPU ondersteund.

Er is geen externe spraak-API nodig.

Voice cloning kan binnen de infrastructuur van de klant worden uitgerold.

Audio en trainingsdata van de klant kunnen volledig binnen de omgeving van de klant blijven.

Huidige on-premise spraakstack · 7 talen

Engels Duits Frans Spaans Italiaans Russisch Turks

Deze 7 talen draaien volledig op Mihu's eigen STT- en TTS-modellen, binnen uw infrastructuur. Het Mihu-cloudplatform ondersteunt via aanvullende spraakmodellen meer dan 40 talen.

5–9%

Typische Word Error Rate (WER) van de huidige implementaties van Mihu STT (Speech-to-Text), afhankelijk van de taal en de evaluatiedataset.

### Lichtgewicht CPU-spraakmodellen

De spraakinfrastructuur van Mihu is ontworpen om de inferentievereisten beperkt te houden. Afhankelijk van de taal en de modelconfiguratie hebben de uitgerolde spraakmodellen ongeveer 66M – 143M parameters.

Daardoor is het mogelijk om STT- en TTS-workloads op CPU-infrastructuur te draaien zonder voor elke spraakworkload een dedicated GPU nodig te hebben.

De werkelijke capaciteit hangt af van

gelijktijdige gesprekken

gekozen taal

gekozen STT/TTS-model

audioconfiguratie

latentiedoel

redundantievereisten

Cijfers over gelijktijdigheid worden per implementatie vastgesteld via benchmarking op de doelhardware en worden niet opgegeven als een vaste verhouding tussen CPU en gesprekken.

Maatwerk

## Private fine-tuning en voice cloning

Eigen spraakdata en merkstemmen blijven op infrastructuur die u beheert.

### Private fine-tuning

Organisaties met hoogwaardige eigen spraakdata kunnen de spraaklaag verder aanpassen. Mihu kan ondersteunde STT/TTS-modellen rechtstreeks fine-tunen op infrastructuur die de klant beheert, zodat eigen datasets niet naar een externe inferentieleverancier hoeven te worden overgedragen.

Maatwerkmodellen kunnen worden

gefinetuned met datasets die de klant aanlevert

geoptimaliseerd voor sectorspecifieke terminologie

aangepast aan accenten en domeinspecifieke spraak

uitsluitend binnen de infrastructuur van de klant uitgerold

privé gehouden, volledig binnen uw eigen infrastructuur

Bijzonder nuttig voor organisaties met gespecialiseerde terminologie, regionale accenten of strikte vereisten voor dataresidentie.

### Voice cloning

Mihu On-Premise ondersteunt ook private voice cloning. Aangeleverde stemsamples kunnen worden gebruikt om organisatiespecifieke stemmen te creëren, die vervolgens binnen de eigen infrastructuur van de klant worden gehost.

Zowel de bronopnames als het resulterende stemmodel kunnen privé blijven.

Zo kunnen ondernemingen consistente merkstemmen creëren zonder tijdens productie-inferentie afhankelijk te zijn van een externe TTS-leverancier.

Vereiste voor het stemvoorbeeld: ongeveer 30 seconden heldere spraak, opgenomen zonder lange pauzes of stiltes tussen zinnen.

Meertalige architectuur

## Taalspecifiek op CPU of meertalig op GPU

De lichtgewicht CPU-spraakmodellen zijn primair taalspecifiek in plaats van één meertalig model. Voor AI-agenten die tijdens dezelfde interactie dynamisch van taal moeten wisselen, ondersteunt Mihu meerdere implementatiestrategieën.

CPU-efficiëntie

### Modelorkestratie

Meerdere taalspecifieke spraakmodellen draaien tegelijkertijd. De orkestratielaag van Mihu detecteert of ontvangt de actieve taal en stuurt de spraakverwerking dynamisch naar het juiste model.

Ook overrides op systeemniveau kunnen de modelkeuze tijdens een interactie sturen.

Maximale meertalige flexibiliteit

### Meertalige GPU-modellen

Voor scenario's met zeer dynamische meertalige gesprekken kunnen in plaats daarvan grotere meertalige spraakmodellen op GPU-infrastructuur worden uitgerold.

De architectuur wordt geoptimaliseerd voor ofwel CPU-efficiëntie met taalspecifieke modellen, ofwel maximale meertalige flexibiliteit met GPU-modellen, afhankelijk van de workload.

Let op: meertalige STT en meertalige TTS vereisen beide GPU-infrastructuur. Het CPU-only spraakpad geldt voor de taalspecifieke Mihu STT- en Mihu TTS-modellen.

Lokale LLM-infrastructuur

## De redeneerlaag draait op open-weight modellen binnen uw omgeving.

De redeneerlaag draait volledig binnen uw omgeving op open-weight LLM's: modellen waarvan de gewichten publiek zijn vrijgegeven en die volledig offline op uw eigen hardware kunnen draaien, zonder verbinding met de modelleverancier. Mihu evalueert doorlopend nieuwe open-weight modellen in plaats van de on-premise stack permanent aan één modelfamilie te binden.

Krachtige LLM-implementaties vereisen doorgaans GPU-infrastructuur. Het aanbevolen model kan veranderen naarmate er nieuwe modellen beschikbaar komen, en Mihu kan het redeneermodel onafhankelijk van de rest van de agentinfrastructuur bijwerken of vervangen.

De infrastructuur is modelonafhankelijk. Het beste beschikbare model kan veranderen; uw architectuur hoeft dat niet.

Aanbevolen configuratie op de implementatiedatum

Het redeneermodel wordt bij de implementatie gekozen uit de actuele evaluatieset. Per september 2026 is Kimi K2.6 Instant een van onze geprefereerde krachtige configuraties. Het draait op dedicated GPU-infrastructuur die boven op de basis van 128 vCPU wordt ingericht. Open-weight alternatieven van andere leveranciers en uit andere regio's, zoals Llama of Mistral, kunnen worden gekozen wanneer er eisen gelden rond inkoop of herkomst van het model. De keuze wordt in elk implementatievoorstel bevestigd.

Mihu Core-infrastructuur

## Waaruit een volledige implementatie bestaat

Een volledige Mihu On-Premise-implementatie bestaat uit meerdere onafhankelijke services. Alle kerncomponenten worden geleverd als gecontaineriseerde Docker-services en uitgerold op Kubernetes met Rancher of Helm.

01

### Mihu Core

Kernruntime voor AI-agenten en bedrijfslogica.

02

### Mihu Orchestration

Coördineert spraakmodellen, LLM's, agenten en runtimediensten.

03

### Mihu Relay

Realtime communicatielaag tussen diensten en agentsessies.

04

### SIP-infrastructuur

Verzorgt enterprisetelefonie en SIP-connectiviteit.

05

### Broadcastdiensten

Ondersteunt uitgaande en grootschalige communicatieworkloads.

06

### Action Server

Voert tools, integraties en agentacties uit.

07

### Beheer- / webapplicatie

Interface voor administratie, configuratie en operationeel beheer.

08

### Database-infrastructuur

Persistente opslag van applicatie- en operationele data.

09

### Redis-infrastructuur

Realtime state, caching en gedistribueerde runtimecoördinatie.

### Optionele infrastructuur

Aanvullende Mihu-functionaliteit kan eveneens on-premise worden uitgerold. Deze componenten vragen extra servercapaciteit, afhankelijk van het gebruik.

### Mihu Builder

Voor het genereren en uitvoeren van eigen services, code, integraties en workflows. Het draaien van Builder vereist extra GPU-capaciteit op de server.

### Mihu MCP Server

Voor het ontsluiten van de Mihu-workspace en de bijbehorende functionaliteit naar MCP-compatibele AI-systemen.

### PBX Connector Server

Koppelt uw bestaande PBX of telefoniesysteem aan de Mihu SIP-infrastructuur voor inkomende en uitgaande gesprekken.

### SMTP-server

Vereist als u het e-mailkanaal wilt koppelen. Agent- en notificatie-e-mails worden via uw eigen SMTP-server verzonden.

Observability en logging

## Dedicated observability voor productie-implementaties

Productie-implementaties dienen te beschikken over dedicated observability-infrastructuur. Mihu adviseert aparte infrastructuur voor centrale logging en monitoring.

### Centrale logging

Logs van Mihu Core, orkestratie, SIP, relay, modelservers en applicatiediensten worden centraal verzameld.

### Monitoring

Infrastructuur- en applicatiemetrics worden doorlopend gemonitord. Er kunnen meldingen worden gegenereerd wanneer vooraf gedefinieerde operationele drempelwaarden worden overschreden.

Gemonitorde metrics

CPU-gebruik

Geheugengebruik

GPU-gebruik

Schijfcapaciteit

Netwerkstatus

Servicestatus

Latentie van modelinferentie

Wachtrijdiepte

Gespreksinfrastructuur

Applicatiefouten

Netwerkarchitectuur

## Geen externe connectiviteit vereist

Alle Mihu-services draaien op servers binnen het eigen netwerk van de klant. Voor productie is geen VPN, tunnel of permanente verbinding met Mihu nodig.

Interne AI-services hoeven niet publiek toegankelijk te zijn. Telefonie bereikt de SIP-infrastructuur via de bestaande carrier- of PBX-koppeling van de klant, en de netwerkregels worden volledig bepaald door het infrastructuur- en beveiligingsbeleid van de klant.

Klantnetwerk

Toegangspunten SIP trunk / PBX Webapp API

Core / Orchestration / SIP

STT LLM TTS Acties

DB / Caching / Opslag

Operations Logs Meldingen Monitoring

Infrastructuurvereisten

## Productiebasislijn

Voor een Mihu On-Premise installatie in productie wordt de initiële infrastructuurconfiguratie bepaald aan de hand van de verwachte gelijktijdigheid en workloads.

### Rekenkracht

128 vCPU

Aanbevolen minimum · kernservices en CPU-spraaklaag

+ GPU

Afhankelijk van het gekozen model · bijv. Kimi K2.6 Instant, Qwen, Llama of Mistral; het aanbevolen model kan in de loop van de tijd veranderen

De basis van 128 vCPU dekt de Mihu Core-services en CPU-gebaseerde STT/TTS. Ze dekt niet de redeneerlaag: een krachtige zelf gehoste LLM zoals Kimi K2.6 Instant vereist boven op deze basis dedicated GPU-infrastructuur, gedimensioneerd op het gekozen model en de verwachte gelijktijdigheid. Bij keuze voor een kleiner open-weight model neemt de GPU-behoefte navenant af. GPU-capaciteit wordt ook toegevoegd wanneer meertalige GPU-spraakmodellen nodig zijn. De exacte toewijzing hangt af van gelijktijdige AI-gesprekken, STT/TTS-belasting, uitgerolde talen, LLM-keuze, redundantieconfiguratie en aanvullende services zoals Builder en MCP.

De verdeling tussen fysieke cores en vCPU's wordt in het implementatievoorstel bevestigd.

### Opslag

gesprekken × gemiddelde duur × opnameformaat × bewaartermijn

Opnamecapaciteit

De opslagvereisten hangen primair af van de vraag of gespreksopnames en andere media lokaal worden bewaard. De applicatiedatabases van Mihu vereisen persistente opslag, terwijl de opnamecapaciteit apart wordt berekend. Klanten die opnames maanden of jaren bewaren, dienen een dedicated opslagvolume te voorzien dat is afgestemd op hun bewaarbeleid.

Klanten bepalen zelf hun

bewaartermijn voor opnames

bewaartermijn voor transcripties

back-upbeleid

archiveringsbeleid

verwijderingsbeleid

### Hoge beschikbaarheid

99.9%

Operationeel beschikbaarheidsdoel

De productiearchitectuur kan worden geconfigureerd met redundantie voor kritieke Mihu-diensten. Het behalen van dit doel vereist dat de overeengekomen productiearchitectuur, redundantie en infrastructuurvereisten in stand worden gehouden.

Voor enterprise on-premise installaties wordt dedicated operationeel eigenaarschap toegewezen. Bij afwezigheid van storingen in de onderliggende infrastructuur of hardware buiten de operationele verantwoordelijkheid van Mihu is de implementatie ontworpen op het overeengekomen doel van 99.9% servicebeschikbaarheid. De verantwoordelijkheden per laag zijn vastgelegd in het SLA-document.

Implementatie

## Vooraf geconfigureerd, gedockeriseerd en geleverd samen met uw infrastructuurteam

De volledige Mihu-stack wordt geleverd als vooraf geconfigureerde Dockerdiensten. Het engineeringteam van Mihu verzorgt de implementatieconfiguratie en de productiegereedheid samen met het infrastructuurteam van de klant. Een typische on-premise implementatie wordt in 3–6 maanden opgeleverd, van infrastructuurvoorbereiding tot productie, en is beschikbaar voor enterpriseklanten.

Voorbereiding van de infrastructuur

Netwerkconfiguratie

Mihu-diensten

Spraakmodellen

LLM

Telefonie

Opslag

Observability

Validatie

Productie

Kubernetes: de stack kan met Helm-charts worden uitgerold. Het standaard en snelste pad van Mihu is een door Rancher beheerde Kubernetes-implementatie.

### Versiebeheer en releases

Mihu On-Premise gebruikt branch-gebaseerd versiebeheer: elke klantimplementatie draait op een eigen release-branch en updates worden als maandelijkse releases geleverd. Elke release wordt vóór uitrol gevalideerd en in overleg met het infrastructuurteam van de klant toegepast, zodat upgrades gepland worden in plaats van opgelegd. De releasevalidatie omvat de standaard testsuite; sommige unittests kunnen verschillen afhankelijk van klantspecifieke aanpassingen.

### Dedicated supportteam

Voor elke on-premise omgeving wijst Mihu een customer success-team en een DevOps-team toe die samen met uw team werken. Support verloopt via een gedeelde Slack-groep, zodat operationele vragen, releasecoördinatie en incidenten rechtstreeks worden afgehandeld met de mensen die uw implementatie kennen.

## Alles blijft binnen.

Een overzicht op één pagina van wat waar draait in een Mihu On-Premise implementatie.

Spraak On-premise

Mihu STT CPU

Mihu TTS CPU

Voice cloning Privé

LLM Open weights / zelfgehost

Fine-tuning Op infrastructuur van de klant

Telefonie SIP

Data Onder controle van de klant

Opnames Onder controle van de klant

Database On-premise

Integraties On-premise Action Server

Implementatie Gedockeriseerd · Kubernetes (Rancher / Helm)

Connectiviteit Binnen het klantnetwerk

Observability Dedicated

SLA-doel 99.9%

Oplevering 3–6 maanden tot productie

Beschikbaarheid Enterpriseklanten

Ondersteuning Customer success- + DevOps-team, gedeelde Slack-groep

Releases Maandelijks, branch-gebaseerd versiebeheer

FAQ

## Mihu AI On-Premise — Veelgestelde vragen

Wat draait er precies binnen onze infrastructuur?

De volledige stack: Speech-to-Text, Text-to-Speech, voice cloning, de LLM-redeneerlaag, orkestratie, SIP-telefonie, de Action Server voor integraties, de beheerapplicatie en de database- en Redis-lagen. Klantgegevens hoeven uw omgeving niet te verlaten.

Hebben wij GPU's nodig?

Niet voor de spraaklaag. STT en TTS draaien op CPU met modellen van ongeveer 66M tot 143M parameters. Krachtige open-weight LLM's vereisen doorgaans GPU-infrastructuur, en GPU-capaciteit wordt ook toegevoegd wanneer u kiest voor grotere meertalige spraakmodellen.

Welke talen ondersteunt de on-premise spraakstack?

De huidige on-premise CPU-spraakstack ondersteunt zeven talen: Engels, Duits, Frans, Spaans, Italiaans, Russisch en Turks. Deze taalspecifieke Mihu STT- en Mihu TTS-modellen draaien op CPU, zonder GPU's. Mihu STT haalt doorgaans een Word Error Rate (WER) van ongeveer 5–9%; het exacte cijfer hangt af van de taal en de evaluatiedataset.

Welk LLM wordt gebruikt en kan dit later worden gewijzigd?

De redeneerlaag is modelonafhankelijk en draait op open-weight modellen. Mihu adviseert een model op de implementatiedatum, en alternatieven van andere leveranciers en uit andere regio's, bijvoorbeeld Llama of Mistral naast Kimi K2.6 Instant, kunnen worden gekozen om te voldoen aan eisen rond inkoop of herkomst van het model. Het model kan onafhankelijk van de rest van de agentinfrastructuur worden bijgewerkt of vervangen zodra er betere open-weight modellen beschikbaar komen.

Kunnen wij de spraakmodellen fine-tunen op onze eigen data?

Ja. Ondersteunde STT- en TTS-modellen kunnen met uw eigen datasets worden gefinetuned op infrastructuur die de klant beheert, zodat eigen audio nooit naar een externe leverancier gaat. De resulterende modellen blijven privé voor uw organisatie.

Welke infrastructuur hebben wij nodig om te starten?

Een typische productiebasis begint bij 128 vCPU voor de Mihu-kernservices en de CPU-gebaseerde spraaklaag. De zelf gehoste LLM wordt apart gedimensioneerd en vereist boven op die basis dedicated GPU-infrastructuur; GPU-capaciteit wordt ook toegevoegd voor meertalige GPU-spraakmodellen. Opslag wordt gedimensioneerd op basis van uw bewaarbeleid voor opnames en transcripties. De exacte dimensionering wordt bevestigd in het implementatievoorstel.

Hoe wordt de implementatie geleverd en verbonden?

Alles wordt geleverd als vooraf geconfigureerde Docker-services en draait op de eigen servers van de klant. Voor productie is geen VPN of terugverbinding naar Mihu nodig, en geen enkele interne AI-service hoeft publiek toegankelijk te zijn. Het engineeringteam van Mihu verzorgt de implementatieconfiguratie samen met uw infrastructuurteam.

Kunnen jullie STT en TTS trainen voor een taal buiten de huidige zeven?

Ja. Nieuwe talen kunnen op verzoek worden toegevoegd. De trainingsinspanning verschilt per taalgroep, en STT en TTS worden afzonderlijk getraind. Mihu kan de trainingsdataset voor u leveren of aanschaffen, of werken met data die u aanlevert. De training draait op machines die u beschikbaar stelt of op infrastructuur die Mihu levert, en de resulterende Mihu STT- en Mihu TTS-modellen worden daarna precies zoals de standaardmodellen binnen uw omgeving geïmplementeerd.

## Plant u een on-premise implementatie?

Deel uw verwachte gelijktijdigheid, talen en vereisten voor dataresidentie. Ons engineeringteam komt bij u terug met een sizingvoorstel en een implementatieplan.

Neem contact op met Sales (https://mihu.ai/nl/contact)
