# Déploiement On-Premise — Mihu AI

Mihu AI On-Premise

# Vos agents. Vos modèles. Vos voix. Votre infrastructure. Vos données.

Mihu exécute l'ensemble de la pile d'agents IA — de la parole au raisonnement, de la téléphonie aux actions — au sein de votre infrastructure. Les données clients n'ont pas à quitter votre environnement.

Contacter le service commercial (https://mihu.ai/fr/contact) Prérequis de déploiement (https://mihu.ai/fr/on-premise#requirements)

7

Langues vocales on-premise

CPU

Inférence Mihu STT & TTS

99.9%

Objectif de disponibilité

Périmètre de déploiement

Au sein de votre réseau

Téléphonie

Infrastructure SIP, services de diffusion

Local

Parole

Mihu STT, Mihu TTS et clonage vocal sur CPU

Local

Raisonnement

LLM open-weight, auto-hébergé

Local

Actions

Action Server, intégrations, workflows

Local

Données

Base de données, Redis, enregistrements, transcriptions

Local

Livré sous forme de services Docker conteneurisés sur une infrastructure gérée par le client, déployé sur Kubernetes avec Rancher ou Helm.

Vue d'ensemble

## Une infrastructure vocale IA privée, déployée intégralement dans votre environnement.

Mihu AI On-Premise est une offre entreprise qui permet aux organisations d'exécuter l'ensemble de la pile d'agents Mihu AI au sein de leur propre infrastructure.

Le traitement de la parole, l'inférence IA, l'orchestration, la téléphonie, les intégrations, les services applicatifs et le stockage des données peuvent fonctionner sans que les données clients quittent l'environnement de l'organisation.

L'ensemble du déploiement est livré sous forme de services Docker conteneurisés et s'exécute sur une infrastructure gérée par le client, déployé sur Kubernetes avec Rancher ou Helm.

Parole

On-premise, inférence CPU

LLM

Modèles open-weight, auto-hébergés

Téléphonie

SIP au sein de votre réseau

Données

Stockage contrôlé par le client

Infrastructure vocale

## Mihu STT & Mihu TTS, entièrement on-premise.

Mihu fournit ses propres modèles vocaux — Mihu STT (Speech-to-Text) et Mihu TTS (Text-to-Speech) — entièrement on-premise. Pour les déploiements pris en charge :

Mihu STT (Speech-to-Text) s'exécute localement.

Mihu TTS (Text-to-Speech) s'exécute localement.

L'inférence CPU uniquement est prise en charge pour la couche vocale.

Aucune API vocale externe n'est requise.

Le clonage vocal peut être déployé au sein de l'infrastructure du client.

Les données audio et d'entraînement du client peuvent rester entièrement dans son environnement.

Pile vocale on-premise actuelle · 7 langues

Anglais Allemand Français Espagnol Italien Russe Turc

Ces 7 langues fonctionnent entièrement sur les modèles STT et TTS propres à Mihu, au sein de votre infrastructure. La plateforme cloud Mihu prend en charge plus de 40 langues grâce à des modèles vocaux supplémentaires.

5–9%

Taux d'erreur sur les mots (WER) typique des déploiements Mihu STT (Speech-to-Text) actuels, selon la langue et le jeu de données d'évaluation.

### Modèles vocaux légers pour CPU

L'infrastructure vocale de Mihu est conçue pour limiter les besoins d'inférence. Selon la langue et la configuration du modèle, les modèles vocaux déployés comptent environ 66M – 143M paramètres.

Il est ainsi possible d'exécuter les charges STT et TTS sur une infrastructure CPU sans dédier un GPU à chaque charge vocale.

La capacité réelle dépend de

nombre de conversations simultanées

langue sélectionnée

modèle STT/TTS sélectionné

configuration audio

objectif de latence

exigences de redondance

Les chiffres de simultanéité sont établis pour chaque déploiement au moyen de tests de performance sur le matériel cible, et non annoncés sous forme de ratio fixe entre CPU et appels.

Personnalisation

## Fine-tuning privé et clonage vocal

Vos données vocales propriétaires et vos voix de marque restent sur une infrastructure que vous contrôlez.

### Fine-tuning privé

Les organisations disposant de données vocales propriétaires de qualité peuvent personnaliser davantage la couche vocale. Mihu peut affiner les modèles STT/TTS pris en charge directement sur une infrastructure contrôlée par le client, de sorte que les jeux de données propriétaires n'aient pas à être transférés vers un fournisseur d'inférence tiers.

Les modèles personnalisés peuvent être

affinés à partir de jeux de données fournis par le client

optimisés pour une terminologie sectorielle

adaptés aux accents et au vocabulaire métier

déployés exclusivement au sein de l'infrastructure du client

conservés privés, entièrement au sein de votre propre infrastructure

Particulièrement utile pour les organisations ayant un vocabulaire spécialisé, des accents régionaux ou des exigences strictes de résidence des données.

### Clonage vocal

Mihu On-Premise prend également en charge le clonage vocal privé. Les échantillons vocaux fournis peuvent servir à créer des voix propres à l'organisation, hébergées ensuite au sein de sa propre infrastructure.

Les enregistrements sources comme le modèle de voix obtenu peuvent rester privés.

Les entreprises peuvent ainsi créer des voix de marque cohérentes sans dépendre d'un fournisseur TTS externe lors de l'inférence en production.

Exigence pour l'échantillon vocal : environ 30 secondes de parole nette, enregistrée sans longues pauses ni silences entre les phrases.

Architecture multilingue

## Spécifique à une langue sur CPU, ou multilingue sur GPU

Les modèles vocaux légers pour CPU sont principalement spécifiques à une langue plutôt qu'un modèle multilingue unique. Pour les agents IA qui doivent changer de langue dynamiquement au cours d'une même interaction, Mihu prend en charge plusieurs stratégies de déploiement.

Efficacité CPU

### Orchestration de modèles

Plusieurs modèles vocaux spécifiques à une langue s'exécutent simultanément. La couche d'orchestration de Mihu détecte ou reçoit la langue active et achemine dynamiquement le traitement vocal vers le modèle approprié.

Des paramètres définis au niveau du système peuvent également contrôler la sélection du modèle pendant une interaction.

Flexibilité multilingue maximale

### Modèles multilingues sur GPU

Pour les scénarios nécessitant des conversations multilingues très dynamiques, des modèles vocaux multilingues plus volumineux peuvent être déployés sur une infrastructure GPU.

L'architecture est optimisée soit pour l'efficacité CPU avec des modèles spécifiques à une langue, soit pour une flexibilité multilingue maximale avec des modèles GPU, selon la charge de travail.

Remarque : le STT multilingue et le TTS multilingue nécessitent tous deux une infrastructure GPU. Le fonctionnement sur CPU seul s'applique aux modèles Mihu STT et Mihu TTS spécifiques à chaque langue.

Infrastructure LLM locale

## La couche de raisonnement s'appuie sur des modèles open-weight, dans votre environnement.

La couche de raisonnement fonctionne entièrement dans votre environnement à l'aide de LLM open-weight : des modèles dont les poids sont publiés publiquement et qui peuvent s'exécuter totalement hors ligne sur votre propre matériel, sans aucune connexion au fournisseur du modèle. Mihu évalue en continu les nouveaux modèles open-weight plutôt que de lier durablement la pile on-premise à une seule famille de modèles.

Les déploiements LLM haute performance nécessitent généralement une infrastructure GPU. Le modèle recommandé peut évoluer à mesure que de nouveaux modèles sont disponibles, et Mihu peut mettre à jour ou remplacer le modèle de raisonnement indépendamment du reste de l'infrastructure d'agents.

L'infrastructure est agnostique vis-à-vis du modèle. Le meilleur modèle disponible peut changer ; votre architecture, non.

Configuration recommandée à la date du déploiement

Le modèle de raisonnement est sélectionné au moment du déploiement parmi l'ensemble d'évaluation en cours. En septembre 2026, l'une de nos configurations haute performance privilégiées est Kimi K2.6 Instant. Il s'exécute sur une infrastructure GPU dédiée, provisionnée en plus de la base de 128 vCPU. Lorsque des exigences d'achat ou d'origine du modèle s'appliquent, des alternatives open-weight d'autres fournisseurs et d'autres régions, comme Llama ou Mistral, peuvent être retenues. Le choix est confirmé dans chaque proposition de déploiement.

Infrastructure Mihu Core

## Ce que comprend un déploiement complet

Un déploiement Mihu On-Premise complet se compose de plusieurs services indépendants. Tous les composants cœur sont livrés sous forme de services Docker conteneurisés et déployés sur Kubernetes avec Rancher ou Helm.

01

### Mihu Core

Runtime des agents IA et logique métier.

02

### Mihu Orchestration

Coordonne les modèles vocaux, les LLM, les agents et les services d'exécution.

03

### Mihu Relay

Couche de communication en temps réel entre les services et les sessions d'agents.

04

### Infrastructure SIP

Gère la téléphonie d'entreprise et la connectivité SIP.

05

### Services de diffusion

Prend en charge les charges de communication sortante et à fort volume.

06

### Action Server

Exécute les outils, les intégrations et les actions des agents.

07

### Administration / Application web

Interface d'administration, de configuration et de gestion opérationnelle.

08

### Infrastructure de base de données

Stockage persistant des données applicatives et opérationnelles.

09

### Infrastructure Redis

État en temps réel, mise en cache et coordination distribuée de l'exécution.

### Infrastructure optionnelle

D'autres fonctionnalités Mihu peuvent également être déployées on-premise. Ces composants nécessitent une capacité serveur supplémentaire selon l'usage.

### Mihu Builder

Pour générer et exécuter des services, du code, des intégrations et des workflows personnalisés. L'exécution de Builder nécessite une capacité GPU supplémentaire sur le serveur.

### Mihu MCP Server

Pour exposer l'espace de travail Mihu et ses capacités aux systèmes IA compatibles MCP.

### PBX Connector Server

Relie votre PBX ou système de téléphonie existant à l'infrastructure SIP de Mihu pour les appels entrants et sortants.

### Serveur SMTP

Requis si vous souhaitez connecter le canal e-mail. Les e-mails des agents et de notification sont envoyés via votre propre serveur SMTP.

Observabilité et journalisation

## Une observabilité dédiée pour les déploiements en production

Les déploiements en production doivent inclure une infrastructure d'observabilité dédiée. Mihu recommande une infrastructure distincte pour la journalisation et la supervision centralisées.

### Journalisation centralisée

Les journaux de Mihu Core, de l'orchestration, du SIP, du relay, des serveurs de modèles et des services applicatifs sont collectés de manière centralisée.

### Supervision

Les métriques d'infrastructure et d'application sont supervisées en continu. Des alertes peuvent être générées lorsque des seuils opérationnels prédéfinis sont dépassés.

Métriques supervisées

Utilisation CPU

Utilisation mémoire

Utilisation GPU

Capacité disque

État du réseau

État des services

Latence d'inférence des modèles

Profondeur de file d'attente

Infrastructure d'appels

Erreurs applicatives

Architecture réseau

## Aucune connectivité externe requise

Tous les services Mihu s'exécutent sur des serveurs situés dans le réseau du client. Aucun VPN, tunnel ni connexion permanente vers Mihu n'est nécessaire en production.

Les services IA internes n'ont pas besoin d'être exposés publiquement. La téléphonie atteint l'infrastructure SIP via la connectivité opérateur ou PBX existante du client, et les règles réseau sont entièrement définies par les politiques d'infrastructure et de sécurité du client.

Réseau du client

Points d'entrée SIP trunk / PBX Application web API

Core / Orchestration / SIP

STT LLM TTS Actions

DB / Cache / Stockage

Exploitation Journaux Notifications Supervision

Prérequis d'infrastructure

## Socle de production

Pour une installation Mihu On-Premise en production, la configuration d'infrastructure initiale est déterminée en fonction de la simultanéité et des charges attendues.

### Calcul

128 vCPU

Minimum recommandé · services cœur et couche vocale sur CPU

+ GPU

Selon le modèle retenu · ex. Kimi K2.6 Instant, Qwen, Llama ou Mistral ; le modèle recommandé peut évoluer

La base de 128 vCPU couvre les services Mihu Core et le STT/TTS sur CPU. Elle ne couvre pas la couche de raisonnement : un LLM auto-hébergé haute performance tel que Kimi K2.6 Instant nécessite une infrastructure GPU dédiée en plus de cette base, dimensionnée selon le modèle retenu et la concurrence attendue. Le choix d'un modèle open-weight plus petit réduit d'autant l'empreinte GPU. De la capacité GPU est également ajoutée lorsque des modèles vocaux multilingues sur GPU sont requis. L'allocation exacte dépend des conversations IA simultanées, de la charge STT/TTS, des langues déployées, du choix du LLM, de la configuration de redondance et des services additionnels tels que Builder et MCP.

Le choix entre cœurs physiques et vCPU est confirmé dans la proposition de déploiement.

### Stockage

appels × durée moyenne × format d'enregistrement × durée de conservation

Capacité d'enregistrement

Les besoins de stockage dépendent avant tout de la conservation locale ou non des enregistrements d'appels et des autres médias. Les bases de données applicatives Mihu nécessitent un stockage persistant, tandis que la capacité d'enregistrement est calculée séparément. Les clients conservant des mois ou des années d'enregistrements doivent prévoir un volume de stockage dédié, dimensionné selon leur politique de conservation.

Les clients définissent eux-mêmes

la conservation des enregistrements

la conservation des transcriptions

la politique de sauvegarde

la politique d'archivage

la politique de suppression

### Haute disponibilité

99.9%

Objectif de disponibilité opérationnelle

L'architecture de production peut être configurée avec de la redondance sur les services Mihu critiques. Atteindre cet objectif suppose que l'architecture de production, la redondance et les prérequis d'infrastructure convenus soient maintenus.

Une responsabilité opérationnelle dédiée est assignée aux installations on-premise en entreprise. En l'absence de défaillances d'infrastructure ou de matériel hors du périmètre opérationnel de Mihu, le déploiement est conçu pour atteindre l'objectif de disponibilité de service convenu de 99,9 %. Les responsabilités par couche sont définies dans le document SLA.

Déploiement

## Préconfiguré, conteneurisé avec Docker et déployé avec votre équipe infrastructure

L'ensemble de la pile Mihu est fourni sous forme de services Docker préconfigurés. L'équipe d'ingénierie de Mihu prend en charge la configuration du déploiement et la mise en production avec l'équipe infrastructure du client. Un déploiement on-premise type est livré en 3 à 6 mois, de la préparation de l'infrastructure jusqu'à la production, et il est proposé aux clients grands comptes.

Préparation de l'infrastructure

Configuration réseau

Services Mihu

Modèles vocaux

LLM

Téléphonie

Stockage

Observabilité

Validation

Production

Kubernetes : la pile peut être déployée avec des charts Helm. La voie standard et la plus rapide chez Mihu est un déploiement Kubernetes géré par Rancher.

### Versionnement et releases

Mihu On-Premise utilise un versionnement par branche : chaque déploiement client s'exécute sur sa propre branche de release et les mises à jour sont livrées sous forme de releases mensuelles. Chaque release est validée avant le déploiement et appliquée en coordination avec l'équipe infrastructure du client, de sorte que les mises à niveau sont planifiées et non imposées. La validation des releases couvre la suite de tests standard ; certains tests unitaires peuvent différer selon les personnalisations propres au client.

### Une équipe de support dédiée

Pour chaque environnement on-premise, Mihu affecte une équipe customer success et une équipe DevOps qui travaillent aux côtés de la vôtre. Le support s'organise via un groupe Slack partagé : les questions opérationnelles, la coordination des releases et les incidents sont traités directement avec les personnes qui connaissent votre déploiement.

## Tout reste chez vous.

Une vue sur une page de ce qui s'exécute, et où, dans un déploiement Mihu On-Premise.

Parole On-premise

Mihu STT CPU

Mihu TTS CPU

Clonage vocal Privé

LLM Modèles open-weight / auto-hébergés

Fine-tuning Sur l'infrastructure du client

Téléphonie SIP

Données Contrôlées par le client

Enregistrements Contrôlés par le client

Base de données On-premise

Intégrations Action Server on-premise

Déploiement Conteneurisé Docker · Kubernetes (Rancher / Helm)

Connectivité Dans le réseau du client

Observabilité Dédiée

Objectif SLA 99.9%

Livraison 3 à 6 mois jusqu'à la production

Disponible pour Clients grands comptes

Support Équipe customer success + DevOps, groupe Slack partagé

Releases Mensuelles, versionnement par branche

FAQ

## Mihu AI On-Premise — Questions fréquentes

Qu'est-ce qui s'exécute réellement dans notre infrastructure ?

L'ensemble de la pile : Speech-to-Text, Text-to-Speech, clonage vocal, la couche de raisonnement LLM, l'orchestration, la téléphonie SIP, l'Action Server pour les intégrations, l'application d'administration ainsi que les couches base de données et Redis. Les données clients n'ont pas à quitter votre environnement.

Avons-nous besoin de GPU ?

Pas pour la couche vocale. Le STT et le TTS s'exécutent sur CPU avec des modèles d'environ 66M à 143M paramètres. Les LLM open-weight haute performance nécessitent généralement une infrastructure GPU, et de la capacité GPU est également ajoutée si vous choisissez des modèles vocaux multilingues plus volumineux.

Quelles langues la pile vocale on-premise prend-elle en charge ?

La pile vocale CPU on-premise actuelle prend en charge sept langues : anglais, allemand, français, espagnol, italien, russe et turc. Ces modèles Mihu STT et Mihu TTS spécifiques à chaque langue s'exécutent sur CPU, sans GPU. Mihu STT atteint généralement un taux d'erreur sur les mots (WER) d'environ 5 à 9 % ; la valeur exacte dépend de la langue et du jeu de données d'évaluation.

Quel LLM est utilisé, et peut-il être changé par la suite ?

La couche de raisonnement est agnostique vis-à-vis du modèle et exécute des modèles open-weight. Mihu recommande un modèle à la date du déploiement, et des alternatives de fournisseurs et de régions différents, par exemple Llama ou Mistral aux côtés de Kimi K2.6 Instant, peuvent être retenues pour répondre à des exigences d'achat ou d'origine du modèle. Le modèle peut être mis à jour ou remplacé indépendamment du reste de l'infrastructure d'agents à mesure que de meilleurs modèles open-weight deviennent disponibles.

Pouvons-nous affiner les modèles vocaux avec nos propres données ?

Oui. Les modèles STT et TTS pris en charge peuvent être affinés sur une infrastructure contrôlée par le client à partir de vos propres jeux de données : vos fichiers audio propriétaires ne sont jamais transmis à un fournisseur tiers. Les modèles obtenus restent privés à votre organisation.

De quelle infrastructure avons-nous besoin pour démarrer ?

Une base de production typique démarre à 128 vCPU pour les services cœur de Mihu et la couche vocale sur CPU. Le LLM auto-hébergé est dimensionné séparément et nécessite une infrastructure GPU dédiée en plus de cette base ; de la capacité GPU est également ajoutée pour les modèles vocaux multilingues sur GPU. Le stockage est dimensionné selon votre politique de conservation des enregistrements et des transcriptions. Le dimensionnement exact est confirmé dans la proposition de déploiement.

Comment le déploiement est-il livré et raccordé ?

L'ensemble est livré sous forme de services Docker préconfigurés et s'exécute sur les serveurs du client. Aucun VPN ni connexion retour vers Mihu n'est nécessaire en production, et aucun service IA interne n'a besoin d'être exposé publiquement. L'équipe d'ingénierie de Mihu gère la configuration du déploiement avec votre équipe infrastructure.

Pouvez-vous entraîner le STT et le TTS pour une langue hors des sept actuelles ?

Oui. De nouvelles langues peuvent être ajoutées sur demande. L'effort d'entraînement varie selon le groupe linguistique, et le STT et le TTS sont entraînés séparément. Mihu peut fournir ou acheter le jeu de données d'entraînement pour vous, ou travailler avec les données que vous fournissez. L'entraînement s'exécute sur des machines que vous fournissez ou sur une infrastructure fournie par Mihu, et les modèles Mihu STT et Mihu TTS obtenus sont ensuite déployés dans votre environnement exactement comme les modèles standard.

## Vous planifiez un déploiement on-premise ?

Communiquez-nous votre simultanéité attendue, vos langues et vos exigences de résidence des données. Notre équipe d'ingénierie vous répondra avec une proposition de dimensionnement et un plan de déploiement.

Contacter le service commercial (https://mihu.ai/fr/contact)
