Mihu AI On-Premise

Sus agentes. Sus modelos. Sus voces. Su infraestructura. Sus datos.

Mihu ejecuta la pila completa de agentes de IA —desde la voz y el razonamiento hasta la telefonía y las acciones— dentro de su infraestructura. Los datos de sus clientes no tienen por qué salir de su entorno.

7
Idiomas de voz on-premise
CPU
Inferencia Mihu STT y TTS
99.9%
Objetivo de disponibilidad
Límite del despliegue
Dentro de su red
Telefonía
Infraestructura SIP, servicios de difusión
Local
Voz
Mihu STT, Mihu TTS y clonación de voz en CPU
Local
Razonamiento
LLM open-weight, autoalojado
Local
Acciones
Action Server, integraciones, flujos de trabajo
Local
Datos
Base de datos, Redis, grabaciones, transcripciones
Local
Visión general

Infraestructura privada de voz con IA, desplegada íntegramente dentro de su entorno.

Mihu AI On-Premise es una oferta empresarial que permite a las organizaciones ejecutar la pila completa de agentes de Mihu AI dentro de su propia infraestructura.

El procesamiento de voz, la inferencia de IA, la orquestación, la telefonía, las integraciones, los servicios de aplicación y el almacenamiento de datos pueden operar sin que los datos del cliente salgan del entorno de la organización.

Todo el despliegue se entrega como servicios Docker en contenedores y se ejecuta en infraestructura gestionada por el cliente, desplegado en Kubernetes con Rancher o Helm.

Voz
On-premise, inferencia en CPU
LLM
Pesos abiertos, autoalojado
Telefonía
SIP dentro de su red
Datos
Almacenamiento controlado por el cliente
Infraestructura de voz

Mihu STT y Mihu TTS, completamente on-premise.

Mihu proporciona sus propios modelos de voz — Mihu STT (Speech-to-Text) y Mihu TTS (Text-to-Speech) — completamente on-premise. Para los despliegues compatibles:

  • Mihu STT (Speech-to-Text) se ejecuta localmente.
  • Mihu TTS (Text-to-Speech) se ejecuta localmente.
  • La capa de voz admite inferencia exclusivamente en CPU.
  • No se requiere ninguna API de voz externa.
  • La clonación de voz puede desplegarse dentro de la infraestructura del cliente.
  • El audio y los datos de entrenamiento del cliente pueden permanecer íntegramente dentro de su entorno.
Pila de voz on-premise actual · 7 idiomas
Inglés Alemán Francés Español Italiano Ruso Turco

Estos 7 idiomas se ejecutan íntegramente con los modelos STT y TTS propios de Mihu, dentro de su infraestructura. La plataforma en la nube de Mihu admite más de 40 idiomas mediante modelos de voz adicionales.

5–9%
Tasa de error de palabra (WER) típica de los despliegues actuales de Mihu STT (Speech-to-Text), en función del idioma y del conjunto de datos de evaluación.

Modelos de voz ligeros para CPU

La infraestructura de voz de Mihu está diseñada para mantener reducidos los requisitos de inferencia. Según el idioma y la configuración del modelo, los modelos de voz desplegados tienen aproximadamente entre 66M y 143M de parámetros.

Esto permite operar cargas de trabajo de STT y TTS sobre infraestructura de CPU sin necesidad de GPU dedicadas para cada carga de trabajo de voz.

La capacidad real depende de
  • las conversaciones simultáneas
  • el idioma seleccionado
  • el modelo de STT/TTS seleccionado
  • la configuración de audio
  • el objetivo de latencia
  • los requisitos de redundancia

Las cifras de concurrencia se establecen en cada despliegue mediante pruebas de rendimiento sobre el hardware de destino; no se indican como una proporción fija de CPU por llamada.

Personalización

Ajuste fino privado y clonación de voz

Los datos de voz propios y las voces de marca permanecen en una infraestructura bajo su control.

Ajuste fino privado

Las organizaciones que disponen de datos de voz propios de alta calidad pueden personalizar aún más la capa de voz. Mihu puede realizar el ajuste fino de los modelos de STT/TTS compatibles directamente sobre infraestructura controlada por el cliente, de modo que los conjuntos de datos propios no tengan que transferirse a un proveedor de inferencia externo.

Los modelos personalizados pueden
  • ajustarse con conjuntos de datos proporcionados por el cliente
  • optimizarse para la terminología específica del sector
  • adaptarse a acentos y al lenguaje propio del dominio
  • desplegarse exclusivamente dentro de la infraestructura del cliente
  • mantenidos privados, íntegramente dentro de su propia infraestructura

Especialmente útil para organizaciones con vocabulario especializado, acentos regionales o requisitos estrictos de residencia de datos.

Clonación de voz

Mihu On-Premise también admite la clonación de voz privada. Las muestras de voz proporcionadas pueden utilizarse para crear voces específicas de la organización, que se alojan a continuación dentro de la propia infraestructura del cliente.

Tanto las grabaciones de origen como el modelo de voz resultante pueden permanecer privados.

Esto permite a las empresas crear voces de marca coherentes sin depender de un proveedor de TTS externo durante la inferencia en producción.

Requisito de la muestra de voz: aproximadamente 30 segundos de habla limpia, grabada sin pausas largas ni silencios entre frases.

Arquitectura multiidioma

Específico por idioma en CPU o multilingüe en GPU

Los modelos de voz ligeros para CPU son principalmente específicos de cada idioma, en lugar de un único modelo multilingüe. Para los agentes de IA que necesitan cambiar de idioma de forma dinámica durante una misma interacción, Mihu admite varias estrategias de despliegue.

Eficiencia en CPU

Orquestación de modelos

Varios modelos de voz específicos por idioma se ejecutan simultáneamente. La capa de orquestación de Mihu detecta o recibe el idioma activo y dirige dinámicamente el procesamiento de voz al modelo adecuado.

La selección del modelo durante una interacción también puede controlarse mediante anulaciones a nivel de sistema.

Máxima flexibilidad multilingüe

Modelos multilingües en GPU

Para escenarios que requieren conversaciones multilingües altamente dinámicas, pueden desplegarse en su lugar modelos de voz multilingües de mayor tamaño sobre infraestructura de GPU.

La arquitectura se optimiza, en función de la carga de trabajo, bien para la eficiencia en CPU con modelos específicos por idioma, bien para la máxima flexibilidad multilingüe con modelos basados en GPU.

Nota: tanto el STT multilingüe como el TTS multilingüe requieren infraestructura GPU. La ruta de voz solo en CPU se aplica a los modelos Mihu STT y Mihu TTS específicos por idioma.

Infraestructura LLM local

La capa de razonamiento se ejecuta sobre modelos open-weight dentro de su entorno.

La capa de razonamiento se ejecuta íntegramente dentro de su entorno con LLM open-weight: modelos cuyos pesos se publican de forma abierta y pueden funcionar totalmente sin conexión en su propio hardware, sin ningún enlace con el proveedor del modelo. Mihu evalúa continuamente nuevos modelos open-weight en lugar de vincular de forma permanente la pila on-premise a una única familia de modelos.

Los despliegues de LLM de alto rendimiento requieren por lo general infraestructura de GPU. El modelo recomendado puede cambiar a medida que aparecen nuevos modelos, y Mihu puede actualizar o sustituir el modelo de razonamiento con independencia del resto de la infraestructura de agentes.

La infraestructura es agnóstica al modelo. El mejor modelo disponible puede cambiar; su arquitectura no tiene por qué hacerlo.

Configuración recomendada en la fecha de despliegue

El modelo de razonamiento se selecciona en el momento del despliegue a partir del conjunto de evaluación vigente. A septiembre de 2026, una de nuestras configuraciones de alto rendimiento preferidas es Kimi K2.6 Instant. Se ejecuta en infraestructura GPU dedicada, aprovisionada además de la base de 128 vCPU. Cuando existan requisitos de compra o de origen del modelo, pueden seleccionarse alternativas open-weight de otros proveedores y regiones, como Llama o Mistral. La selección se confirma en cada propuesta de despliegue.

Infraestructura Mihu Core

En qué consiste un despliegue completo

Un despliegue completo de Mihu On-Premise consta de varios servicios independientes. Todos los componentes principales se entregan como servicios Docker en contenedores y se despliegan en Kubernetes con Rancher o Helm.

01

Mihu Core

Runtime principal del agente de IA y lógica de negocio.

02

Mihu Orchestration

Coordina los modelos de voz, los LLM, los agentes y los servicios de ejecución.

03

Mihu Relay

Capa de comunicación en tiempo real entre los servicios y las sesiones de agente.

04

Infraestructura SIP

Gestiona la telefonía empresarial y la conectividad SIP.

05

Servicios de difusión

Da soporte a cargas de trabajo de comunicación saliente y de alto volumen.

06

Action Server

Ejecuta herramientas, integraciones y acciones del agente.

07

Gestión / Aplicación web

Interfaz de administración, configuración y gestión operativa.

08

Infraestructura de base de datos

Almacenamiento persistente de los datos de aplicación y operativos.

09

Infraestructura Redis

Estado en tiempo real, caché y coordinación distribuida en ejecución.

Infraestructura opcional

También pueden desplegarse on-premise capacidades adicionales de Mihu. Estos componentes requieren capacidad de servidor adicional en función del uso.

Mihu Builder

Para generar y ejecutar servicios, código, integraciones y flujos de trabajo personalizados. Ejecutar Builder requiere capacidad GPU adicional en el servidor.

Mihu MCP Server

Para exponer el espacio de trabajo y las capacidades de Mihu a sistemas de IA compatibles con MCP.

PBX Connector Server

Conecta su PBX o sistema de telefonía existente con la infraestructura SIP de Mihu para llamadas entrantes y salientes.

Servidor SMTP

Necesario si desea conectar el canal de correo electrónico. Los correos de los agentes y de notificación se envían a través de su propio servidor SMTP.

Observabilidad y registro

Observabilidad dedicada para despliegues en producción

Los despliegues en producción deben incluir una infraestructura de observabilidad dedicada. Mihu recomienda una infraestructura independiente para el registro y la monitorización centralizados.

Registro centralizado

Los registros de Mihu Core, la orquestación, SIP, el relay, los servidores de modelos y los servicios de aplicación se recopilan de forma centralizada.

Monitorización

Las métricas de infraestructura y de aplicación se monitorizan de forma continua. Pueden generarse alertas cuando se superan los umbrales operativos predefinidos.

Métricas monitorizadas
  • Uso de CPU
  • Uso de memoria
  • Uso de GPU
  • Capacidad de disco
  • Estado de la red
  • Estado de los servicios
  • Latencia de inferencia de los modelos
  • Profundidad de cola
  • Infraestructura de llamadas
  • Errores de la aplicación
Arquitectura de red

No se requiere conectividad externa

Todos los servicios de Mihu se ejecutan en servidores dentro de la propia red del cliente. Para la operación en producción no se requiere VPN, túnel ni conexión permanente con Mihu.

Los servicios internos de IA no necesitan exposición pública. La telefonía llega a la infraestructura SIP a través de la conectividad existente del cliente con su operador o PBX, y las reglas de red se definen íntegramente según las políticas de infraestructura y seguridad del cliente.

Red del cliente
Puntos de entradaSIP trunk / PBXAplicación webAPI
Core / Orquestación / SIP
STTLLMTTSAcciones
DB / Caché / Almacenamiento
OperacionesRegistrosNotificacionesMonitorización
Requisitos de infraestructura

Base de producción

Para una instalación de Mihu On-Premise en producción, la configuración inicial de la infraestructura se determina en función de la concurrencia y las cargas de trabajo previstas.

Cómputo

128 vCPU
Mínimo recomendado · servicios principales y capa de voz en CPU
+ GPU
Según el modelo seleccionado · p. ej. Kimi K2.6 Instant, Qwen, Llama o Mistral; el modelo recomendado puede cambiar con el tiempo

La base de 128 vCPU cubre los servicios Mihu Core y el STT/TTS en CPU. No cubre la capa de razonamiento: un LLM autoalojado de alto rendimiento como Kimi K2.6 Instant requiere infraestructura GPU dedicada además de esta base, dimensionada según el modelo seleccionado y la concurrencia prevista. Si se selecciona un modelo open-weight más pequeño, la necesidad de GPU se reduce en consecuencia. También se añade capacidad GPU cuando se requieren modelos de voz multilingües en GPU. La asignación exacta depende de las conversaciones de IA simultáneas, la carga de STT/TTS, los idiomas desplegados, la elección del LLM, la configuración de redundancia y servicios adicionales como Builder y MCP.

La asignación de núcleos físicos frente a vCPU se confirma en la propuesta de despliegue.

Almacenamiento

llamadas × duración media × formato de grabación × periodo de retención
Capacidad de grabación

Los requisitos de almacenamiento dependen principalmente de si las grabaciones de llamadas y otros contenidos multimedia se conservan localmente. Las bases de datos de la aplicación Mihu requieren almacenamiento persistente, mientras que la capacidad de grabación se calcula por separado. Los clientes que conserven meses o años de grabaciones deben aprovisionar un volumen de almacenamiento dedicado, dimensionado según su política de retención.

Los clientes definen sus propias políticas de
  • retención de grabaciones
  • retención de transcripciones
  • copias de seguridad
  • archivado
  • eliminación

Alta disponibilidad

99.9%
Objetivo de disponibilidad operativa

La arquitectura de producción puede configurarse con redundancia en los servicios críticos de Mihu. Alcanzar este objetivo exige mantener la arquitectura de producción, la redundancia y los requisitos de infraestructura acordados.

Para las instalaciones on-premise empresariales se asigna una responsabilidad operativa dedicada. Salvo fallos de la infraestructura o del hardware subyacentes ajenos a la responsabilidad operativa de Mihu, el despliegue está diseñado para alcanzar el objetivo acordado de 99.9% de disponibilidad del servicio. Las responsabilidades capa por capa se definen en el documento de SLA.

Despliegue

Preconfigurado, en contenedores Docker y entregado junto con su equipo de infraestructura

La pila completa de Mihu se proporciona como servicios Docker preconfigurados. El equipo de ingeniería de Mihu se encarga de la configuración del despliegue y de la preparación para producción junto con el equipo de infraestructura del cliente. Un despliegue on-premise típico se entrega en 3–6 meses, desde la preparación de la infraestructura hasta la producción, y está disponible para clientes empresariales.

  1. Preparación de la infraestructura
  2. Configuración de red
  3. Servicios de Mihu
  4. Modelos de voz
  5. LLM
  6. Telefonía
  7. Almacenamiento
  8. Observabilidad
  9. Validación
  10. Producción

Kubernetes: la pila puede desplegarse con charts de Helm. La vía estándar y más rápida de Mihu es un despliegue de Kubernetes gestionado con Rancher.

Versionado y releases

Mihu On-Premise utiliza versionado basado en ramas: cada despliegue de cliente se ejecuta en su propia rama de release y las actualizaciones se entregan como releases mensuales. Cada release se valida antes del despliegue y se aplica en coordinación con el equipo de infraestructura del cliente, de modo que las actualizaciones se programan en lugar de imponerse. La validación de cada release cubre el conjunto de pruebas estándar; algunas pruebas unitarias pueden variar en función de las personalizaciones específicas de cada cliente.

Equipo de soporte dedicado

Para cada entorno on-premise, Mihu asigna un equipo de customer success y un equipo de DevOps que trabajan junto a su equipo. El soporte se canaliza a través de un grupo de Slack compartido, de modo que las consultas operativas, la coordinación de releases y las incidencias se gestionan directamente con las personas que conocen su despliegue.

Todo permanece dentro.

Una vista de una sola página de qué se ejecuta y dónde en un despliegue de Mihu On-Premise.

VozOn-premise
Mihu STTCPU
Mihu TTSCPU
Clonación de vozPrivada
LLMPesos abiertos / autoalojado
Ajuste finoEn la infraestructura del cliente
TelefoníaSIP
DatosControlados por el cliente
GrabacionesControladas por el cliente
Base de datosOn-premise
IntegracionesAction Server on-premise
DespliegueEn contenedores Docker · Kubernetes (Rancher / Helm)
ConectividadDentro de la red del cliente
ObservabilidadDedicada
Objetivo de SLA99.9%
Entrega3–6 meses hasta producción
DisponibilidadClientes empresariales
SoporteEquipo de customer success + DevOps, grupo de Slack compartido
ReleasesMensuales, versionado por ramas
Preguntas frecuentes

Mihu AI On-Premise — Preguntas frecuentes

¿Qué se ejecuta realmente dentro de nuestra infraestructura?

La pila completa: Speech-to-Text, Text-to-Speech, clonación de voz, la capa de razonamiento con LLM, la orquestación, la telefonía SIP, el Action Server para las integraciones, la aplicación de gestión y las capas de base de datos y Redis. Los datos de sus clientes no tienen por qué salir de su entorno.

¿Necesitamos GPU?

No para la capa de voz. El STT y el TTS se ejecutan en CPU con modelos de aproximadamente 66M a 143M de parámetros. Los LLM open-weight de alto rendimiento requieren por lo general infraestructura de GPU, y también se añade capacidad de GPU si opta por modelos de voz multilingües de mayor tamaño.

¿Qué idiomas admite la pila de voz on-premise?

La pila de voz on-premise en CPU actual admite siete idiomas: inglés, alemán, francés, español, italiano, ruso y turco. Estos modelos Mihu STT y Mihu TTS específicos por idioma se ejecutan en CPU, sin GPU. Mihu STT alcanza normalmente una tasa de error de palabra (WER) de alrededor del 5–9 %; la cifra exacta depende del idioma y del conjunto de datos de evaluación.

¿Qué LLM se utiliza y puede cambiarse más adelante?

La capa de razonamiento es agnóstica al modelo y ejecuta modelos open-weight. Mihu recomienda un modelo en la fecha del despliegue y, para cumplir requisitos de compra o de origen del modelo, pueden seleccionarse alternativas de otros proveedores y regiones, por ejemplo Llama o Mistral junto a Kimi K2.6 Instant. El modelo puede actualizarse o sustituirse con independencia del resto de la infraestructura de agentes a medida que aparecen mejores modelos open-weight.

¿Podemos ajustar los modelos de voz con nuestros propios datos?

Sí. Los modelos de STT y TTS compatibles pueden ajustarse sobre infraestructura controlada por el cliente utilizando sus propios conjuntos de datos, de modo que el audio propio nunca llega a un proveedor externo. Los modelos resultantes permanecen privados para su organización.

¿Qué infraestructura necesitamos para empezar?

Una base de producción típica comienza en 128 vCPU para los servicios principales de Mihu y la capa de voz en CPU. El LLM autoalojado se dimensiona por separado y requiere infraestructura GPU dedicada además de esa base; también se añade capacidad GPU para modelos de voz multilingües en GPU. El almacenamiento se dimensiona según su política de retención de grabaciones y transcripciones. El dimensionamiento exacto se confirma en la propuesta de despliegue.

¿Cómo se entrega y se conecta el despliegue?

Todo se entrega como servicios Docker preconfigurados y se ejecuta en los propios servidores del cliente. Para la operación en producción no se requiere VPN ni conexión de retorno con Mihu, y ningún servicio interno de IA necesita exposición pública. El equipo de ingeniería de Mihu gestiona la configuración del despliegue junto con su equipo de infraestructura.

¿Pueden entrenar STT y TTS para un idioma fuera de los siete actuales?

Sí. Se pueden añadir nuevos idiomas bajo petición. El esfuerzo de entrenamiento varía según el grupo lingüístico, y el STT y el TTS se entrenan por separado. Mihu puede proporcionar o adquirir el conjunto de datos de entrenamiento por usted, o trabajar con los datos que usted facilite. El entrenamiento se ejecuta en máquinas que usted proporciona o en infraestructura proporcionada por Mihu, y los modelos Mihu STT y Mihu TTS resultantes se despliegan después dentro de su entorno exactamente igual que los estándar.

¿Está planificando un despliegue on-premise?

Indíquenos su concurrencia prevista, los idiomas y los requisitos de residencia de datos. Nuestro equipo de ingeniería le responderá con una propuesta de dimensionamiento y un plan de despliegue.