Mihu AI On-Premise

Vos agents. Vos modèles. Vos voix. Votre infrastructure. Vos données.

Mihu exécute l'ensemble de la pile d'agents IA — de la parole au raisonnement, de la téléphonie aux actions — au sein de votre infrastructure. Les données clients n'ont pas à quitter votre environnement.

7
Langues vocales on-premise
CPU
Inférence Mihu STT & TTS
99.9%
Objectif de disponibilité
Périmètre de déploiement
Au sein de votre réseau
Téléphonie
Infrastructure SIP, services de diffusion
Local
Parole
Mihu STT, Mihu TTS et clonage vocal sur CPU
Local
Raisonnement
LLM open-weight, auto-hébergé
Local
Actions
Action Server, intégrations, workflows
Local
Données
Base de données, Redis, enregistrements, transcriptions
Local
Vue d'ensemble

Une infrastructure vocale IA privée, déployée intégralement dans votre environnement.

Mihu AI On-Premise est une offre entreprise qui permet aux organisations d'exécuter l'ensemble de la pile d'agents Mihu AI au sein de leur propre infrastructure.

Le traitement de la parole, l'inférence IA, l'orchestration, la téléphonie, les intégrations, les services applicatifs et le stockage des données peuvent fonctionner sans que les données clients quittent l'environnement de l'organisation.

L'ensemble du déploiement est livré sous forme de services Docker conteneurisés et s'exécute sur une infrastructure gérée par le client, déployé sur Kubernetes avec Rancher ou Helm.

Parole
On-premise, inférence CPU
LLM
Modèles open-weight, auto-hébergés
Téléphonie
SIP au sein de votre réseau
Données
Stockage contrôlé par le client
Infrastructure vocale

Mihu STT & Mihu TTS, entièrement on-premise.

Mihu fournit ses propres modèles vocaux — Mihu STT (Speech-to-Text) et Mihu TTS (Text-to-Speech) — entièrement on-premise. Pour les déploiements pris en charge :

  • Mihu STT (Speech-to-Text) s'exécute localement.
  • Mihu TTS (Text-to-Speech) s'exécute localement.
  • L'inférence CPU uniquement est prise en charge pour la couche vocale.
  • Aucune API vocale externe n'est requise.
  • Le clonage vocal peut être déployé au sein de l'infrastructure du client.
  • Les données audio et d'entraînement du client peuvent rester entièrement dans son environnement.
Pile vocale on-premise actuelle · 7 langues
Anglais Allemand Français Espagnol Italien Russe Turc

Ces 7 langues fonctionnent entièrement sur les modèles STT et TTS propres à Mihu, au sein de votre infrastructure. La plateforme cloud Mihu prend en charge plus de 40 langues grâce à des modèles vocaux supplémentaires.

5–9%
Taux d'erreur sur les mots (WER) typique des déploiements Mihu STT (Speech-to-Text) actuels, selon la langue et le jeu de données d'évaluation.

Modèles vocaux légers pour CPU

L'infrastructure vocale de Mihu est conçue pour limiter les besoins d'inférence. Selon la langue et la configuration du modèle, les modèles vocaux déployés comptent environ 66M – 143M paramètres.

Il est ainsi possible d'exécuter les charges STT et TTS sur une infrastructure CPU sans dédier un GPU à chaque charge vocale.

La capacité réelle dépend de
  • nombre de conversations simultanées
  • langue sélectionnée
  • modèle STT/TTS sélectionné
  • configuration audio
  • objectif de latence
  • exigences de redondance

Les chiffres de simultanéité sont établis pour chaque déploiement au moyen de tests de performance sur le matériel cible, et non annoncés sous forme de ratio fixe entre CPU et appels.

Personnalisation

Fine-tuning privé et clonage vocal

Vos données vocales propriétaires et vos voix de marque restent sur une infrastructure que vous contrôlez.

Fine-tuning privé

Les organisations disposant de données vocales propriétaires de qualité peuvent personnaliser davantage la couche vocale. Mihu peut affiner les modèles STT/TTS pris en charge directement sur une infrastructure contrôlée par le client, de sorte que les jeux de données propriétaires n'aient pas à être transférés vers un fournisseur d'inférence tiers.

Les modèles personnalisés peuvent être
  • affinés à partir de jeux de données fournis par le client
  • optimisés pour une terminologie sectorielle
  • adaptés aux accents et au vocabulaire métier
  • déployés exclusivement au sein de l'infrastructure du client
  • conservés privés, entièrement au sein de votre propre infrastructure

Particulièrement utile pour les organisations ayant un vocabulaire spécialisé, des accents régionaux ou des exigences strictes de résidence des données.

Clonage vocal

Mihu On-Premise prend également en charge le clonage vocal privé. Les échantillons vocaux fournis peuvent servir à créer des voix propres à l'organisation, hébergées ensuite au sein de sa propre infrastructure.

Les enregistrements sources comme le modèle de voix obtenu peuvent rester privés.

Les entreprises peuvent ainsi créer des voix de marque cohérentes sans dépendre d'un fournisseur TTS externe lors de l'inférence en production.

Exigence pour l'échantillon vocal : environ 30 secondes de parole nette, enregistrée sans longues pauses ni silences entre les phrases.

Architecture multilingue

Spécifique à une langue sur CPU, ou multilingue sur GPU

Les modèles vocaux légers pour CPU sont principalement spécifiques à une langue plutôt qu'un modèle multilingue unique. Pour les agents IA qui doivent changer de langue dynamiquement au cours d'une même interaction, Mihu prend en charge plusieurs stratégies de déploiement.

Efficacité CPU

Orchestration de modèles

Plusieurs modèles vocaux spécifiques à une langue s'exécutent simultanément. La couche d'orchestration de Mihu détecte ou reçoit la langue active et achemine dynamiquement le traitement vocal vers le modèle approprié.

Des paramètres définis au niveau du système peuvent également contrôler la sélection du modèle pendant une interaction.

Flexibilité multilingue maximale

Modèles multilingues sur GPU

Pour les scénarios nécessitant des conversations multilingues très dynamiques, des modèles vocaux multilingues plus volumineux peuvent être déployés sur une infrastructure GPU.

L'architecture est optimisée soit pour l'efficacité CPU avec des modèles spécifiques à une langue, soit pour une flexibilité multilingue maximale avec des modèles GPU, selon la charge de travail.

Remarque : le STT multilingue et le TTS multilingue nécessitent tous deux une infrastructure GPU. Le fonctionnement sur CPU seul s'applique aux modèles Mihu STT et Mihu TTS spécifiques à chaque langue.

Infrastructure LLM locale

La couche de raisonnement s'appuie sur des modèles open-weight, dans votre environnement.

La couche de raisonnement fonctionne entièrement dans votre environnement à l'aide de LLM open-weight : des modèles dont les poids sont publiés publiquement et qui peuvent s'exécuter totalement hors ligne sur votre propre matériel, sans aucune connexion au fournisseur du modèle. Mihu évalue en continu les nouveaux modèles open-weight plutôt que de lier durablement la pile on-premise à une seule famille de modèles.

Les déploiements LLM haute performance nécessitent généralement une infrastructure GPU. Le modèle recommandé peut évoluer à mesure que de nouveaux modèles sont disponibles, et Mihu peut mettre à jour ou remplacer le modèle de raisonnement indépendamment du reste de l'infrastructure d'agents.

L'infrastructure est agnostique vis-à-vis du modèle. Le meilleur modèle disponible peut changer ; votre architecture, non.

Configuration recommandée à la date du déploiement

Le modèle de raisonnement est sélectionné au moment du déploiement parmi l'ensemble d'évaluation en cours. En septembre 2026, l'une de nos configurations haute performance privilégiées est Kimi K2.6 Instant. Il s'exécute sur une infrastructure GPU dédiée, provisionnée en plus de la base de 128 vCPU. Lorsque des exigences d'achat ou d'origine du modèle s'appliquent, des alternatives open-weight d'autres fournisseurs et d'autres régions, comme Llama ou Mistral, peuvent être retenues. Le choix est confirmé dans chaque proposition de déploiement.

Infrastructure Mihu Core

Ce que comprend un déploiement complet

Un déploiement Mihu On-Premise complet se compose de plusieurs services indépendants. Tous les composants cœur sont livrés sous forme de services Docker conteneurisés et déployés sur Kubernetes avec Rancher ou Helm.

01

Mihu Core

Runtime des agents IA et logique métier.

02

Mihu Orchestration

Coordonne les modèles vocaux, les LLM, les agents et les services d'exécution.

03

Mihu Relay

Couche de communication en temps réel entre les services et les sessions d'agents.

04

Infrastructure SIP

Gère la téléphonie d'entreprise et la connectivité SIP.

05

Services de diffusion

Prend en charge les charges de communication sortante et à fort volume.

06

Action Server

Exécute les outils, les intégrations et les actions des agents.

07

Administration / Application web

Interface d'administration, de configuration et de gestion opérationnelle.

08

Infrastructure de base de données

Stockage persistant des données applicatives et opérationnelles.

09

Infrastructure Redis

État en temps réel, mise en cache et coordination distribuée de l'exécution.

Infrastructure optionnelle

D'autres fonctionnalités Mihu peuvent également être déployées on-premise. Ces composants nécessitent une capacité serveur supplémentaire selon l'usage.

Mihu Builder

Pour générer et exécuter des services, du code, des intégrations et des workflows personnalisés. L'exécution de Builder nécessite une capacité GPU supplémentaire sur le serveur.

Mihu MCP Server

Pour exposer l'espace de travail Mihu et ses capacités aux systèmes IA compatibles MCP.

PBX Connector Server

Relie votre PBX ou système de téléphonie existant à l'infrastructure SIP de Mihu pour les appels entrants et sortants.

Serveur SMTP

Requis si vous souhaitez connecter le canal e-mail. Les e-mails des agents et de notification sont envoyés via votre propre serveur SMTP.

Observabilité et journalisation

Une observabilité dédiée pour les déploiements en production

Les déploiements en production doivent inclure une infrastructure d'observabilité dédiée. Mihu recommande une infrastructure distincte pour la journalisation et la supervision centralisées.

Journalisation centralisée

Les journaux de Mihu Core, de l'orchestration, du SIP, du relay, des serveurs de modèles et des services applicatifs sont collectés de manière centralisée.

Supervision

Les métriques d'infrastructure et d'application sont supervisées en continu. Des alertes peuvent être générées lorsque des seuils opérationnels prédéfinis sont dépassés.

Métriques supervisées
  • Utilisation CPU
  • Utilisation mémoire
  • Utilisation GPU
  • Capacité disque
  • État du réseau
  • État des services
  • Latence d'inférence des modèles
  • Profondeur de file d'attente
  • Infrastructure d'appels
  • Erreurs applicatives
Architecture réseau

Aucune connectivité externe requise

Tous les services Mihu s'exécutent sur des serveurs situés dans le réseau du client. Aucun VPN, tunnel ni connexion permanente vers Mihu n'est nécessaire en production.

Les services IA internes n'ont pas besoin d'être exposés publiquement. La téléphonie atteint l'infrastructure SIP via la connectivité opérateur ou PBX existante du client, et les règles réseau sont entièrement définies par les politiques d'infrastructure et de sécurité du client.

Réseau du client
Points d'entréeSIP trunk / PBXApplication webAPI
Core / Orchestration / SIP
STTLLMTTSActions
DB / Cache / Stockage
ExploitationJournauxNotificationsSupervision
Prérequis d'infrastructure

Socle de production

Pour une installation Mihu On-Premise en production, la configuration d'infrastructure initiale est déterminée en fonction de la simultanéité et des charges attendues.

Calcul

128 vCPU
Minimum recommandé · services cœur et couche vocale sur CPU
+ GPU
Selon le modèle retenu · ex. Kimi K2.6 Instant, Qwen, Llama ou Mistral ; le modèle recommandé peut évoluer

La base de 128 vCPU couvre les services Mihu Core et le STT/TTS sur CPU. Elle ne couvre pas la couche de raisonnement : un LLM auto-hébergé haute performance tel que Kimi K2.6 Instant nécessite une infrastructure GPU dédiée en plus de cette base, dimensionnée selon le modèle retenu et la concurrence attendue. Le choix d'un modèle open-weight plus petit réduit d'autant l'empreinte GPU. De la capacité GPU est également ajoutée lorsque des modèles vocaux multilingues sur GPU sont requis. L'allocation exacte dépend des conversations IA simultanées, de la charge STT/TTS, des langues déployées, du choix du LLM, de la configuration de redondance et des services additionnels tels que Builder et MCP.

Le choix entre cœurs physiques et vCPU est confirmé dans la proposition de déploiement.

Stockage

appels × durée moyenne × format d'enregistrement × durée de conservation
Capacité d'enregistrement

Les besoins de stockage dépendent avant tout de la conservation locale ou non des enregistrements d'appels et des autres médias. Les bases de données applicatives Mihu nécessitent un stockage persistant, tandis que la capacité d'enregistrement est calculée séparément. Les clients conservant des mois ou des années d'enregistrements doivent prévoir un volume de stockage dédié, dimensionné selon leur politique de conservation.

Les clients définissent eux-mêmes
  • la conservation des enregistrements
  • la conservation des transcriptions
  • la politique de sauvegarde
  • la politique d'archivage
  • la politique de suppression

Haute disponibilité

99.9%
Objectif de disponibilité opérationnelle

L'architecture de production peut être configurée avec de la redondance sur les services Mihu critiques. Atteindre cet objectif suppose que l'architecture de production, la redondance et les prérequis d'infrastructure convenus soient maintenus.

Une responsabilité opérationnelle dédiée est assignée aux installations on-premise en entreprise. En l'absence de défaillances d'infrastructure ou de matériel hors du périmètre opérationnel de Mihu, le déploiement est conçu pour atteindre l'objectif de disponibilité de service convenu de 99,9 %. Les responsabilités par couche sont définies dans le document SLA.

Déploiement

Préconfiguré, conteneurisé avec Docker et déployé avec votre équipe infrastructure

L'ensemble de la pile Mihu est fourni sous forme de services Docker préconfigurés. L'équipe d'ingénierie de Mihu prend en charge la configuration du déploiement et la mise en production avec l'équipe infrastructure du client. Un déploiement on-premise type est livré en 3 à 6 mois, de la préparation de l'infrastructure jusqu'à la production, et il est proposé aux clients grands comptes.

  1. Préparation de l'infrastructure
  2. Configuration réseau
  3. Services Mihu
  4. Modèles vocaux
  5. LLM
  6. Téléphonie
  7. Stockage
  8. Observabilité
  9. Validation
  10. Production

Kubernetes : la pile peut être déployée avec des charts Helm. La voie standard et la plus rapide chez Mihu est un déploiement Kubernetes géré par Rancher.

Versionnement et releases

Mihu On-Premise utilise un versionnement par branche : chaque déploiement client s'exécute sur sa propre branche de release et les mises à jour sont livrées sous forme de releases mensuelles. Chaque release est validée avant le déploiement et appliquée en coordination avec l'équipe infrastructure du client, de sorte que les mises à niveau sont planifiées et non imposées. La validation des releases couvre la suite de tests standard ; certains tests unitaires peuvent différer selon les personnalisations propres au client.

Une équipe de support dédiée

Pour chaque environnement on-premise, Mihu affecte une équipe customer success et une équipe DevOps qui travaillent aux côtés de la vôtre. Le support s'organise via un groupe Slack partagé : les questions opérationnelles, la coordination des releases et les incidents sont traités directement avec les personnes qui connaissent votre déploiement.

Tout reste chez vous.

Une vue sur une page de ce qui s'exécute, et où, dans un déploiement Mihu On-Premise.

ParoleOn-premise
Mihu STTCPU
Mihu TTSCPU
Clonage vocalPrivé
LLMModèles open-weight / auto-hébergés
Fine-tuningSur l'infrastructure du client
TéléphonieSIP
DonnéesContrôlées par le client
EnregistrementsContrôlés par le client
Base de donnéesOn-premise
IntégrationsAction Server on-premise
DéploiementConteneurisé Docker · Kubernetes (Rancher / Helm)
ConnectivitéDans le réseau du client
ObservabilitéDédiée
Objectif SLA99.9%
Livraison3 à 6 mois jusqu'à la production
Disponible pourClients grands comptes
SupportÉquipe customer success + DevOps, groupe Slack partagé
ReleasesMensuelles, versionnement par branche
FAQ

Mihu AI On-Premise — Questions fréquentes

Qu'est-ce qui s'exécute réellement dans notre infrastructure ?

L'ensemble de la pile : Speech-to-Text, Text-to-Speech, clonage vocal, la couche de raisonnement LLM, l'orchestration, la téléphonie SIP, l'Action Server pour les intégrations, l'application d'administration ainsi que les couches base de données et Redis. Les données clients n'ont pas à quitter votre environnement.

Avons-nous besoin de GPU ?

Pas pour la couche vocale. Le STT et le TTS s'exécutent sur CPU avec des modèles d'environ 66M à 143M paramètres. Les LLM open-weight haute performance nécessitent généralement une infrastructure GPU, et de la capacité GPU est également ajoutée si vous choisissez des modèles vocaux multilingues plus volumineux.

Quelles langues la pile vocale on-premise prend-elle en charge ?

La pile vocale CPU on-premise actuelle prend en charge sept langues : anglais, allemand, français, espagnol, italien, russe et turc. Ces modèles Mihu STT et Mihu TTS spécifiques à chaque langue s'exécutent sur CPU, sans GPU. Mihu STT atteint généralement un taux d'erreur sur les mots (WER) d'environ 5 à 9 % ; la valeur exacte dépend de la langue et du jeu de données d'évaluation.

Quel LLM est utilisé, et peut-il être changé par la suite ?

La couche de raisonnement est agnostique vis-à-vis du modèle et exécute des modèles open-weight. Mihu recommande un modèle à la date du déploiement, et des alternatives de fournisseurs et de régions différents, par exemple Llama ou Mistral aux côtés de Kimi K2.6 Instant, peuvent être retenues pour répondre à des exigences d'achat ou d'origine du modèle. Le modèle peut être mis à jour ou remplacé indépendamment du reste de l'infrastructure d'agents à mesure que de meilleurs modèles open-weight deviennent disponibles.

Pouvons-nous affiner les modèles vocaux avec nos propres données ?

Oui. Les modèles STT et TTS pris en charge peuvent être affinés sur une infrastructure contrôlée par le client à partir de vos propres jeux de données : vos fichiers audio propriétaires ne sont jamais transmis à un fournisseur tiers. Les modèles obtenus restent privés à votre organisation.

De quelle infrastructure avons-nous besoin pour démarrer ?

Une base de production typique démarre à 128 vCPU pour les services cœur de Mihu et la couche vocale sur CPU. Le LLM auto-hébergé est dimensionné séparément et nécessite une infrastructure GPU dédiée en plus de cette base ; de la capacité GPU est également ajoutée pour les modèles vocaux multilingues sur GPU. Le stockage est dimensionné selon votre politique de conservation des enregistrements et des transcriptions. Le dimensionnement exact est confirmé dans la proposition de déploiement.

Comment le déploiement est-il livré et raccordé ?

L'ensemble est livré sous forme de services Docker préconfigurés et s'exécute sur les serveurs du client. Aucun VPN ni connexion retour vers Mihu n'est nécessaire en production, et aucun service IA interne n'a besoin d'être exposé publiquement. L'équipe d'ingénierie de Mihu gère la configuration du déploiement avec votre équipe infrastructure.

Pouvez-vous entraîner le STT et le TTS pour une langue hors des sept actuelles ?

Oui. De nouvelles langues peuvent être ajoutées sur demande. L'effort d'entraînement varie selon le groupe linguistique, et le STT et le TTS sont entraînés séparément. Mihu peut fournir ou acheter le jeu de données d'entraînement pour vous, ou travailler avec les données que vous fournissez. L'entraînement s'exécute sur des machines que vous fournissez ou sur une infrastructure fournie par Mihu, et les modèles Mihu STT et Mihu TTS obtenus sont ensuite déployés dans votre environnement exactement comme les modèles standard.

Vous planifiez un déploiement on-premise ?

Communiquez-nous votre simultanéité attendue, vos langues et vos exigences de résidence des données. Notre équipe d'ingénierie vous répondra avec une proposition de dimensionnement et un plan de déploiement.