Mihu exécute l'ensemble de la pile d'agents IA — de la parole au raisonnement, de la téléphonie aux actions — au sein de votre infrastructure. Les données clients n'ont pas à quitter votre environnement.
Mihu AI On-Premise est une offre entreprise qui permet aux organisations d'exécuter l'ensemble de la pile d'agents Mihu AI au sein de leur propre infrastructure.
Le traitement de la parole, l'inférence IA, l'orchestration, la téléphonie, les intégrations, les services applicatifs et le stockage des données peuvent fonctionner sans que les données clients quittent l'environnement de l'organisation.
L'ensemble du déploiement est livré sous forme de services Docker conteneurisés et s'exécute sur une infrastructure gérée par le client, déployé sur Kubernetes avec Rancher ou Helm.
Mihu fournit ses propres modèles vocaux — Mihu STT (Speech-to-Text) et Mihu TTS (Text-to-Speech) — entièrement on-premise. Pour les déploiements pris en charge :
Ces 7 langues fonctionnent entièrement sur les modèles STT et TTS propres à Mihu, au sein de votre infrastructure. La plateforme cloud Mihu prend en charge plus de 40 langues grâce à des modèles vocaux supplémentaires.
L'infrastructure vocale de Mihu est conçue pour limiter les besoins d'inférence. Selon la langue et la configuration du modèle, les modèles vocaux déployés comptent environ 66M – 143M paramètres.
Il est ainsi possible d'exécuter les charges STT et TTS sur une infrastructure CPU sans dédier un GPU à chaque charge vocale.
Les chiffres de simultanéité sont établis pour chaque déploiement au moyen de tests de performance sur le matériel cible, et non annoncés sous forme de ratio fixe entre CPU et appels.
Vos données vocales propriétaires et vos voix de marque restent sur une infrastructure que vous contrôlez.
Les organisations disposant de données vocales propriétaires de qualité peuvent personnaliser davantage la couche vocale. Mihu peut affiner les modèles STT/TTS pris en charge directement sur une infrastructure contrôlée par le client, de sorte que les jeux de données propriétaires n'aient pas à être transférés vers un fournisseur d'inférence tiers.
Particulièrement utile pour les organisations ayant un vocabulaire spécialisé, des accents régionaux ou des exigences strictes de résidence des données.
Mihu On-Premise prend également en charge le clonage vocal privé. Les échantillons vocaux fournis peuvent servir à créer des voix propres à l'organisation, hébergées ensuite au sein de sa propre infrastructure.
Les enregistrements sources comme le modèle de voix obtenu peuvent rester privés.
Les entreprises peuvent ainsi créer des voix de marque cohérentes sans dépendre d'un fournisseur TTS externe lors de l'inférence en production.
Exigence pour l'échantillon vocal : environ 30 secondes de parole nette, enregistrée sans longues pauses ni silences entre les phrases.
Les modèles vocaux légers pour CPU sont principalement spécifiques à une langue plutôt qu'un modèle multilingue unique. Pour les agents IA qui doivent changer de langue dynamiquement au cours d'une même interaction, Mihu prend en charge plusieurs stratégies de déploiement.
Plusieurs modèles vocaux spécifiques à une langue s'exécutent simultanément. La couche d'orchestration de Mihu détecte ou reçoit la langue active et achemine dynamiquement le traitement vocal vers le modèle approprié.
Des paramètres définis au niveau du système peuvent également contrôler la sélection du modèle pendant une interaction.
Pour les scénarios nécessitant des conversations multilingues très dynamiques, des modèles vocaux multilingues plus volumineux peuvent être déployés sur une infrastructure GPU.
L'architecture est optimisée soit pour l'efficacité CPU avec des modèles spécifiques à une langue, soit pour une flexibilité multilingue maximale avec des modèles GPU, selon la charge de travail.
Remarque : le STT multilingue et le TTS multilingue nécessitent tous deux une infrastructure GPU. Le fonctionnement sur CPU seul s'applique aux modèles Mihu STT et Mihu TTS spécifiques à chaque langue.
La couche de raisonnement fonctionne entièrement dans votre environnement à l'aide de LLM open-weight : des modèles dont les poids sont publiés publiquement et qui peuvent s'exécuter totalement hors ligne sur votre propre matériel, sans aucune connexion au fournisseur du modèle. Mihu évalue en continu les nouveaux modèles open-weight plutôt que de lier durablement la pile on-premise à une seule famille de modèles.
Les déploiements LLM haute performance nécessitent généralement une infrastructure GPU. Le modèle recommandé peut évoluer à mesure que de nouveaux modèles sont disponibles, et Mihu peut mettre à jour ou remplacer le modèle de raisonnement indépendamment du reste de l'infrastructure d'agents.
L'infrastructure est agnostique vis-à-vis du modèle. Le meilleur modèle disponible peut changer ; votre architecture, non.
Le modèle de raisonnement est sélectionné au moment du déploiement parmi l'ensemble d'évaluation en cours. En septembre 2026, l'une de nos configurations haute performance privilégiées est Kimi K2.6 Instant. Il s'exécute sur une infrastructure GPU dédiée, provisionnée en plus de la base de 128 vCPU. Lorsque des exigences d'achat ou d'origine du modèle s'appliquent, des alternatives open-weight d'autres fournisseurs et d'autres régions, comme Llama ou Mistral, peuvent être retenues. Le choix est confirmé dans chaque proposition de déploiement.
Un déploiement Mihu On-Premise complet se compose de plusieurs services indépendants. Tous les composants cœur sont livrés sous forme de services Docker conteneurisés et déployés sur Kubernetes avec Rancher ou Helm.
Runtime des agents IA et logique métier.
Coordonne les modèles vocaux, les LLM, les agents et les services d'exécution.
Couche de communication en temps réel entre les services et les sessions d'agents.
Gère la téléphonie d'entreprise et la connectivité SIP.
Prend en charge les charges de communication sortante et à fort volume.
Exécute les outils, les intégrations et les actions des agents.
Interface d'administration, de configuration et de gestion opérationnelle.
Stockage persistant des données applicatives et opérationnelles.
État en temps réel, mise en cache et coordination distribuée de l'exécution.
D'autres fonctionnalités Mihu peuvent également être déployées on-premise. Ces composants nécessitent une capacité serveur supplémentaire selon l'usage.
Pour générer et exécuter des services, du code, des intégrations et des workflows personnalisés. L'exécution de Builder nécessite une capacité GPU supplémentaire sur le serveur.
Pour exposer l'espace de travail Mihu et ses capacités aux systèmes IA compatibles MCP.
Relie votre PBX ou système de téléphonie existant à l'infrastructure SIP de Mihu pour les appels entrants et sortants.
Requis si vous souhaitez connecter le canal e-mail. Les e-mails des agents et de notification sont envoyés via votre propre serveur SMTP.
Les déploiements en production doivent inclure une infrastructure d'observabilité dédiée. Mihu recommande une infrastructure distincte pour la journalisation et la supervision centralisées.
Les journaux de Mihu Core, de l'orchestration, du SIP, du relay, des serveurs de modèles et des services applicatifs sont collectés de manière centralisée.
Les métriques d'infrastructure et d'application sont supervisées en continu. Des alertes peuvent être générées lorsque des seuils opérationnels prédéfinis sont dépassés.
Tous les services Mihu s'exécutent sur des serveurs situés dans le réseau du client. Aucun VPN, tunnel ni connexion permanente vers Mihu n'est nécessaire en production.
Les services IA internes n'ont pas besoin d'être exposés publiquement. La téléphonie atteint l'infrastructure SIP via la connectivité opérateur ou PBX existante du client, et les règles réseau sont entièrement définies par les politiques d'infrastructure et de sécurité du client.
Pour une installation Mihu On-Premise en production, la configuration d'infrastructure initiale est déterminée en fonction de la simultanéité et des charges attendues.
La base de 128 vCPU couvre les services Mihu Core et le STT/TTS sur CPU. Elle ne couvre pas la couche de raisonnement : un LLM auto-hébergé haute performance tel que Kimi K2.6 Instant nécessite une infrastructure GPU dédiée en plus de cette base, dimensionnée selon le modèle retenu et la concurrence attendue. Le choix d'un modèle open-weight plus petit réduit d'autant l'empreinte GPU. De la capacité GPU est également ajoutée lorsque des modèles vocaux multilingues sur GPU sont requis. L'allocation exacte dépend des conversations IA simultanées, de la charge STT/TTS, des langues déployées, du choix du LLM, de la configuration de redondance et des services additionnels tels que Builder et MCP.
Le choix entre cœurs physiques et vCPU est confirmé dans la proposition de déploiement.
Les besoins de stockage dépendent avant tout de la conservation locale ou non des enregistrements d'appels et des autres médias. Les bases de données applicatives Mihu nécessitent un stockage persistant, tandis que la capacité d'enregistrement est calculée séparément. Les clients conservant des mois ou des années d'enregistrements doivent prévoir un volume de stockage dédié, dimensionné selon leur politique de conservation.
L'architecture de production peut être configurée avec de la redondance sur les services Mihu critiques. Atteindre cet objectif suppose que l'architecture de production, la redondance et les prérequis d'infrastructure convenus soient maintenus.
Une responsabilité opérationnelle dédiée est assignée aux installations on-premise en entreprise. En l'absence de défaillances d'infrastructure ou de matériel hors du périmètre opérationnel de Mihu, le déploiement est conçu pour atteindre l'objectif de disponibilité de service convenu de 99,9 %. Les responsabilités par couche sont définies dans le document SLA.
L'ensemble de la pile Mihu est fourni sous forme de services Docker préconfigurés. L'équipe d'ingénierie de Mihu prend en charge la configuration du déploiement et la mise en production avec l'équipe infrastructure du client. Un déploiement on-premise type est livré en 3 à 6 mois, de la préparation de l'infrastructure jusqu'à la production, et il est proposé aux clients grands comptes.
Kubernetes : la pile peut être déployée avec des charts Helm. La voie standard et la plus rapide chez Mihu est un déploiement Kubernetes géré par Rancher.
Mihu On-Premise utilise un versionnement par branche : chaque déploiement client s'exécute sur sa propre branche de release et les mises à jour sont livrées sous forme de releases mensuelles. Chaque release est validée avant le déploiement et appliquée en coordination avec l'équipe infrastructure du client, de sorte que les mises à niveau sont planifiées et non imposées. La validation des releases couvre la suite de tests standard ; certains tests unitaires peuvent différer selon les personnalisations propres au client.
Pour chaque environnement on-premise, Mihu affecte une équipe customer success et une équipe DevOps qui travaillent aux côtés de la vôtre. Le support s'organise via un groupe Slack partagé : les questions opérationnelles, la coordination des releases et les incidents sont traités directement avec les personnes qui connaissent votre déploiement.
Une vue sur une page de ce qui s'exécute, et où, dans un déploiement Mihu On-Premise.
L'ensemble de la pile : Speech-to-Text, Text-to-Speech, clonage vocal, la couche de raisonnement LLM, l'orchestration, la téléphonie SIP, l'Action Server pour les intégrations, l'application d'administration ainsi que les couches base de données et Redis. Les données clients n'ont pas à quitter votre environnement.
Pas pour la couche vocale. Le STT et le TTS s'exécutent sur CPU avec des modèles d'environ 66M à 143M paramètres. Les LLM open-weight haute performance nécessitent généralement une infrastructure GPU, et de la capacité GPU est également ajoutée si vous choisissez des modèles vocaux multilingues plus volumineux.
La pile vocale CPU on-premise actuelle prend en charge sept langues : anglais, allemand, français, espagnol, italien, russe et turc. Ces modèles Mihu STT et Mihu TTS spécifiques à chaque langue s'exécutent sur CPU, sans GPU. Mihu STT atteint généralement un taux d'erreur sur les mots (WER) d'environ 5 à 9 % ; la valeur exacte dépend de la langue et du jeu de données d'évaluation.
La couche de raisonnement est agnostique vis-à-vis du modèle et exécute des modèles open-weight. Mihu recommande un modèle à la date du déploiement, et des alternatives de fournisseurs et de régions différents, par exemple Llama ou Mistral aux côtés de Kimi K2.6 Instant, peuvent être retenues pour répondre à des exigences d'achat ou d'origine du modèle. Le modèle peut être mis à jour ou remplacé indépendamment du reste de l'infrastructure d'agents à mesure que de meilleurs modèles open-weight deviennent disponibles.
Oui. Les modèles STT et TTS pris en charge peuvent être affinés sur une infrastructure contrôlée par le client à partir de vos propres jeux de données : vos fichiers audio propriétaires ne sont jamais transmis à un fournisseur tiers. Les modèles obtenus restent privés à votre organisation.
Une base de production typique démarre à 128 vCPU pour les services cœur de Mihu et la couche vocale sur CPU. Le LLM auto-hébergé est dimensionné séparément et nécessite une infrastructure GPU dédiée en plus de cette base ; de la capacité GPU est également ajoutée pour les modèles vocaux multilingues sur GPU. Le stockage est dimensionné selon votre politique de conservation des enregistrements et des transcriptions. Le dimensionnement exact est confirmé dans la proposition de déploiement.
L'ensemble est livré sous forme de services Docker préconfigurés et s'exécute sur les serveurs du client. Aucun VPN ni connexion retour vers Mihu n'est nécessaire en production, et aucun service IA interne n'a besoin d'être exposé publiquement. L'équipe d'ingénierie de Mihu gère la configuration du déploiement avec votre équipe infrastructure.
Oui. De nouvelles langues peuvent être ajoutées sur demande. L'effort d'entraînement varie selon le groupe linguistique, et le STT et le TTS sont entraînés séparément. Mihu peut fournir ou acheter le jeu de données d'entraînement pour vous, ou travailler avec les données que vous fournissez. L'entraînement s'exécute sur des machines que vous fournissez ou sur une infrastructure fournie par Mihu, et les modèles Mihu STT et Mihu TTS obtenus sont ensuite déployés dans votre environnement exactement comme les modèles standard.
Communiquez-nous votre simultanéité attendue, vos langues et vos exigences de résidence des données. Notre équipe d'ingénierie vous répondra avec une proposition de dimensionnement et un plan de déploiement.