Mihu draait de volledige AI-agentstack — van spraak en redeneren tot telefonie en acties — binnen uw infrastructuur. Klantgegevens hoeven uw omgeving niet te verlaten.
Mihu AI On-Premise is een enterpriseaanbod waarmee organisaties de volledige Mihu AI-agentstack binnen hun eigen infrastructuur kunnen draaien.
Spraakverwerking, AI-inferentie, orkestratie, telefonie, integraties, applicatiediensten en dataopslag kunnen functioneren zonder dat klantgegevens de omgeving van de organisatie verlaten.
De volledige implementatie wordt geleverd als gecontaineriseerde Docker-services en draait op door de klant beheerde infrastructuur, uitgerold op Kubernetes met Rancher of Helm.
Mihu levert zijn eigen spraakmodellen — Mihu STT (Speech-to-Text) en Mihu TTS (Text-to-Speech) — volledig on-premise. Voor ondersteunde implementaties:
Deze 7 talen draaien volledig op Mihu's eigen STT- en TTS-modellen, binnen uw infrastructuur. Het Mihu-cloudplatform ondersteunt via aanvullende spraakmodellen meer dan 40 talen.
De spraakinfrastructuur van Mihu is ontworpen om de inferentievereisten beperkt te houden. Afhankelijk van de taal en de modelconfiguratie hebben de uitgerolde spraakmodellen ongeveer 66M – 143M parameters.
Daardoor is het mogelijk om STT- en TTS-workloads op CPU-infrastructuur te draaien zonder voor elke spraakworkload een dedicated GPU nodig te hebben.
Cijfers over gelijktijdigheid worden per implementatie vastgesteld via benchmarking op de doelhardware en worden niet opgegeven als een vaste verhouding tussen CPU en gesprekken.
Eigen spraakdata en merkstemmen blijven op infrastructuur die u beheert.
Organisaties met hoogwaardige eigen spraakdata kunnen de spraaklaag verder aanpassen. Mihu kan ondersteunde STT/TTS-modellen rechtstreeks fine-tunen op infrastructuur die de klant beheert, zodat eigen datasets niet naar een externe inferentieleverancier hoeven te worden overgedragen.
Bijzonder nuttig voor organisaties met gespecialiseerde terminologie, regionale accenten of strikte vereisten voor dataresidentie.
Mihu On-Premise ondersteunt ook private voice cloning. Aangeleverde stemsamples kunnen worden gebruikt om organisatiespecifieke stemmen te creëren, die vervolgens binnen de eigen infrastructuur van de klant worden gehost.
Zowel de bronopnames als het resulterende stemmodel kunnen privé blijven.
Zo kunnen ondernemingen consistente merkstemmen creëren zonder tijdens productie-inferentie afhankelijk te zijn van een externe TTS-leverancier.
Vereiste voor het stemvoorbeeld: ongeveer 30 seconden heldere spraak, opgenomen zonder lange pauzes of stiltes tussen zinnen.
De lichtgewicht CPU-spraakmodellen zijn primair taalspecifiek in plaats van één meertalig model. Voor AI-agenten die tijdens dezelfde interactie dynamisch van taal moeten wisselen, ondersteunt Mihu meerdere implementatiestrategieën.
Meerdere taalspecifieke spraakmodellen draaien tegelijkertijd. De orkestratielaag van Mihu detecteert of ontvangt de actieve taal en stuurt de spraakverwerking dynamisch naar het juiste model.
Ook overrides op systeemniveau kunnen de modelkeuze tijdens een interactie sturen.
Voor scenario's met zeer dynamische meertalige gesprekken kunnen in plaats daarvan grotere meertalige spraakmodellen op GPU-infrastructuur worden uitgerold.
De architectuur wordt geoptimaliseerd voor ofwel CPU-efficiëntie met taalspecifieke modellen, ofwel maximale meertalige flexibiliteit met GPU-modellen, afhankelijk van de workload.
Let op: meertalige STT en meertalige TTS vereisen beide GPU-infrastructuur. Het CPU-only spraakpad geldt voor de taalspecifieke Mihu STT- en Mihu TTS-modellen.
De redeneerlaag draait volledig binnen uw omgeving op open-weight LLM's: modellen waarvan de gewichten publiek zijn vrijgegeven en die volledig offline op uw eigen hardware kunnen draaien, zonder verbinding met de modelleverancier. Mihu evalueert doorlopend nieuwe open-weight modellen in plaats van de on-premise stack permanent aan één modelfamilie te binden.
Krachtige LLM-implementaties vereisen doorgaans GPU-infrastructuur. Het aanbevolen model kan veranderen naarmate er nieuwe modellen beschikbaar komen, en Mihu kan het redeneermodel onafhankelijk van de rest van de agentinfrastructuur bijwerken of vervangen.
De infrastructuur is modelonafhankelijk. Het beste beschikbare model kan veranderen; uw architectuur hoeft dat niet.
Het redeneermodel wordt bij de implementatie gekozen uit de actuele evaluatieset. Per september 2026 is Kimi K2.6 Instant een van onze geprefereerde krachtige configuraties. Het draait op dedicated GPU-infrastructuur die boven op de basis van 128 vCPU wordt ingericht. Open-weight alternatieven van andere leveranciers en uit andere regio's, zoals Llama of Mistral, kunnen worden gekozen wanneer er eisen gelden rond inkoop of herkomst van het model. De keuze wordt in elk implementatievoorstel bevestigd.
Een volledige Mihu On-Premise-implementatie bestaat uit meerdere onafhankelijke services. Alle kerncomponenten worden geleverd als gecontaineriseerde Docker-services en uitgerold op Kubernetes met Rancher of Helm.
Kernruntime voor AI-agenten en bedrijfslogica.
Coördineert spraakmodellen, LLM's, agenten en runtimediensten.
Realtime communicatielaag tussen diensten en agentsessies.
Verzorgt enterprisetelefonie en SIP-connectiviteit.
Ondersteunt uitgaande en grootschalige communicatieworkloads.
Voert tools, integraties en agentacties uit.
Interface voor administratie, configuratie en operationeel beheer.
Persistente opslag van applicatie- en operationele data.
Realtime state, caching en gedistribueerde runtimecoördinatie.
Aanvullende Mihu-functionaliteit kan eveneens on-premise worden uitgerold. Deze componenten vragen extra servercapaciteit, afhankelijk van het gebruik.
Voor het genereren en uitvoeren van eigen services, code, integraties en workflows. Het draaien van Builder vereist extra GPU-capaciteit op de server.
Voor het ontsluiten van de Mihu-workspace en de bijbehorende functionaliteit naar MCP-compatibele AI-systemen.
Koppelt uw bestaande PBX of telefoniesysteem aan de Mihu SIP-infrastructuur voor inkomende en uitgaande gesprekken.
Vereist als u het e-mailkanaal wilt koppelen. Agent- en notificatie-e-mails worden via uw eigen SMTP-server verzonden.
Productie-implementaties dienen te beschikken over dedicated observability-infrastructuur. Mihu adviseert aparte infrastructuur voor centrale logging en monitoring.
Logs van Mihu Core, orkestratie, SIP, relay, modelservers en applicatiediensten worden centraal verzameld.
Infrastructuur- en applicatiemetrics worden doorlopend gemonitord. Er kunnen meldingen worden gegenereerd wanneer vooraf gedefinieerde operationele drempelwaarden worden overschreden.
Alle Mihu-services draaien op servers binnen het eigen netwerk van de klant. Voor productie is geen VPN, tunnel of permanente verbinding met Mihu nodig.
Interne AI-services hoeven niet publiek toegankelijk te zijn. Telefonie bereikt de SIP-infrastructuur via de bestaande carrier- of PBX-koppeling van de klant, en de netwerkregels worden volledig bepaald door het infrastructuur- en beveiligingsbeleid van de klant.
Voor een Mihu On-Premise installatie in productie wordt de initiële infrastructuurconfiguratie bepaald aan de hand van de verwachte gelijktijdigheid en workloads.
De basis van 128 vCPU dekt de Mihu Core-services en CPU-gebaseerde STT/TTS. Ze dekt niet de redeneerlaag: een krachtige zelf gehoste LLM zoals Kimi K2.6 Instant vereist boven op deze basis dedicated GPU-infrastructuur, gedimensioneerd op het gekozen model en de verwachte gelijktijdigheid. Bij keuze voor een kleiner open-weight model neemt de GPU-behoefte navenant af. GPU-capaciteit wordt ook toegevoegd wanneer meertalige GPU-spraakmodellen nodig zijn. De exacte toewijzing hangt af van gelijktijdige AI-gesprekken, STT/TTS-belasting, uitgerolde talen, LLM-keuze, redundantieconfiguratie en aanvullende services zoals Builder en MCP.
De verdeling tussen fysieke cores en vCPU's wordt in het implementatievoorstel bevestigd.
De opslagvereisten hangen primair af van de vraag of gespreksopnames en andere media lokaal worden bewaard. De applicatiedatabases van Mihu vereisen persistente opslag, terwijl de opnamecapaciteit apart wordt berekend. Klanten die opnames maanden of jaren bewaren, dienen een dedicated opslagvolume te voorzien dat is afgestemd op hun bewaarbeleid.
De productiearchitectuur kan worden geconfigureerd met redundantie voor kritieke Mihu-diensten. Het behalen van dit doel vereist dat de overeengekomen productiearchitectuur, redundantie en infrastructuurvereisten in stand worden gehouden.
Voor enterprise on-premise installaties wordt dedicated operationeel eigenaarschap toegewezen. Bij afwezigheid van storingen in de onderliggende infrastructuur of hardware buiten de operationele verantwoordelijkheid van Mihu is de implementatie ontworpen op het overeengekomen doel van 99.9% servicebeschikbaarheid. De verantwoordelijkheden per laag zijn vastgelegd in het SLA-document.
De volledige Mihu-stack wordt geleverd als vooraf geconfigureerde Dockerdiensten. Het engineeringteam van Mihu verzorgt de implementatieconfiguratie en de productiegereedheid samen met het infrastructuurteam van de klant. Een typische on-premise implementatie wordt in 3–6 maanden opgeleverd, van infrastructuurvoorbereiding tot productie, en is beschikbaar voor enterpriseklanten.
Kubernetes: de stack kan met Helm-charts worden uitgerold. Het standaard en snelste pad van Mihu is een door Rancher beheerde Kubernetes-implementatie.
Mihu On-Premise gebruikt branch-gebaseerd versiebeheer: elke klantimplementatie draait op een eigen release-branch en updates worden als maandelijkse releases geleverd. Elke release wordt vóór uitrol gevalideerd en in overleg met het infrastructuurteam van de klant toegepast, zodat upgrades gepland worden in plaats van opgelegd. De releasevalidatie omvat de standaard testsuite; sommige unittests kunnen verschillen afhankelijk van klantspecifieke aanpassingen.
Voor elke on-premise omgeving wijst Mihu een customer success-team en een DevOps-team toe die samen met uw team werken. Support verloopt via een gedeelde Slack-groep, zodat operationele vragen, releasecoördinatie en incidenten rechtstreeks worden afgehandeld met de mensen die uw implementatie kennen.
Een overzicht op één pagina van wat waar draait in een Mihu On-Premise implementatie.
De volledige stack: Speech-to-Text, Text-to-Speech, voice cloning, de LLM-redeneerlaag, orkestratie, SIP-telefonie, de Action Server voor integraties, de beheerapplicatie en de database- en Redis-lagen. Klantgegevens hoeven uw omgeving niet te verlaten.
Niet voor de spraaklaag. STT en TTS draaien op CPU met modellen van ongeveer 66M tot 143M parameters. Krachtige open-weight LLM's vereisen doorgaans GPU-infrastructuur, en GPU-capaciteit wordt ook toegevoegd wanneer u kiest voor grotere meertalige spraakmodellen.
De huidige on-premise CPU-spraakstack ondersteunt zeven talen: Engels, Duits, Frans, Spaans, Italiaans, Russisch en Turks. Deze taalspecifieke Mihu STT- en Mihu TTS-modellen draaien op CPU, zonder GPU's. Mihu STT haalt doorgaans een Word Error Rate (WER) van ongeveer 5–9%; het exacte cijfer hangt af van de taal en de evaluatiedataset.
De redeneerlaag is modelonafhankelijk en draait op open-weight modellen. Mihu adviseert een model op de implementatiedatum, en alternatieven van andere leveranciers en uit andere regio's, bijvoorbeeld Llama of Mistral naast Kimi K2.6 Instant, kunnen worden gekozen om te voldoen aan eisen rond inkoop of herkomst van het model. Het model kan onafhankelijk van de rest van de agentinfrastructuur worden bijgewerkt of vervangen zodra er betere open-weight modellen beschikbaar komen.
Ja. Ondersteunde STT- en TTS-modellen kunnen met uw eigen datasets worden gefinetuned op infrastructuur die de klant beheert, zodat eigen audio nooit naar een externe leverancier gaat. De resulterende modellen blijven privé voor uw organisatie.
Een typische productiebasis begint bij 128 vCPU voor de Mihu-kernservices en de CPU-gebaseerde spraaklaag. De zelf gehoste LLM wordt apart gedimensioneerd en vereist boven op die basis dedicated GPU-infrastructuur; GPU-capaciteit wordt ook toegevoegd voor meertalige GPU-spraakmodellen. Opslag wordt gedimensioneerd op basis van uw bewaarbeleid voor opnames en transcripties. De exacte dimensionering wordt bevestigd in het implementatievoorstel.
Alles wordt geleverd als vooraf geconfigureerde Docker-services en draait op de eigen servers van de klant. Voor productie is geen VPN of terugverbinding naar Mihu nodig, en geen enkele interne AI-service hoeft publiek toegankelijk te zijn. Het engineeringteam van Mihu verzorgt de implementatieconfiguratie samen met uw infrastructuurteam.
Ja. Nieuwe talen kunnen op verzoek worden toegevoegd. De trainingsinspanning verschilt per taalgroep, en STT en TTS worden afzonderlijk getraind. Mihu kan de trainingsdataset voor u leveren of aanschaffen, of werken met data die u aanlevert. De training draait op machines die u beschikbaar stelt of op infrastructuur die Mihu levert, en de resulterende Mihu STT- en Mihu TTS-modellen worden daarna precies zoals de standaardmodellen binnen uw omgeving geïmplementeerd.
Deel uw verwachte gelijktijdigheid, talen en vereisten voor dataresidentie. Ons engineeringteam komt bij u terug met een sizingvoorstel en een implementatieplan.