Mihu ejecuta la pila completa de agentes de IA —desde la voz y el razonamiento hasta la telefonía y las acciones— dentro de su infraestructura. Los datos de sus clientes no tienen por qué salir de su entorno.
Mihu AI On-Premise es una oferta empresarial que permite a las organizaciones ejecutar la pila completa de agentes de Mihu AI dentro de su propia infraestructura.
El procesamiento de voz, la inferencia de IA, la orquestación, la telefonía, las integraciones, los servicios de aplicación y el almacenamiento de datos pueden operar sin que los datos del cliente salgan del entorno de la organización.
Todo el despliegue se entrega como servicios Docker en contenedores y se ejecuta en infraestructura gestionada por el cliente, desplegado en Kubernetes con Rancher o Helm.
Mihu proporciona sus propios modelos de voz — Mihu STT (Speech-to-Text) y Mihu TTS (Text-to-Speech) — completamente on-premise. Para los despliegues compatibles:
Estos 7 idiomas se ejecutan íntegramente con los modelos STT y TTS propios de Mihu, dentro de su infraestructura. La plataforma en la nube de Mihu admite más de 40 idiomas mediante modelos de voz adicionales.
La infraestructura de voz de Mihu está diseñada para mantener reducidos los requisitos de inferencia. Según el idioma y la configuración del modelo, los modelos de voz desplegados tienen aproximadamente entre 66M y 143M de parámetros.
Esto permite operar cargas de trabajo de STT y TTS sobre infraestructura de CPU sin necesidad de GPU dedicadas para cada carga de trabajo de voz.
Las cifras de concurrencia se establecen en cada despliegue mediante pruebas de rendimiento sobre el hardware de destino; no se indican como una proporción fija de CPU por llamada.
Los datos de voz propios y las voces de marca permanecen en una infraestructura bajo su control.
Las organizaciones que disponen de datos de voz propios de alta calidad pueden personalizar aún más la capa de voz. Mihu puede realizar el ajuste fino de los modelos de STT/TTS compatibles directamente sobre infraestructura controlada por el cliente, de modo que los conjuntos de datos propios no tengan que transferirse a un proveedor de inferencia externo.
Especialmente útil para organizaciones con vocabulario especializado, acentos regionales o requisitos estrictos de residencia de datos.
Mihu On-Premise también admite la clonación de voz privada. Las muestras de voz proporcionadas pueden utilizarse para crear voces específicas de la organización, que se alojan a continuación dentro de la propia infraestructura del cliente.
Tanto las grabaciones de origen como el modelo de voz resultante pueden permanecer privados.
Esto permite a las empresas crear voces de marca coherentes sin depender de un proveedor de TTS externo durante la inferencia en producción.
Requisito de la muestra de voz: aproximadamente 30 segundos de habla limpia, grabada sin pausas largas ni silencios entre frases.
Los modelos de voz ligeros para CPU son principalmente específicos de cada idioma, en lugar de un único modelo multilingüe. Para los agentes de IA que necesitan cambiar de idioma de forma dinámica durante una misma interacción, Mihu admite varias estrategias de despliegue.
Varios modelos de voz específicos por idioma se ejecutan simultáneamente. La capa de orquestación de Mihu detecta o recibe el idioma activo y dirige dinámicamente el procesamiento de voz al modelo adecuado.
La selección del modelo durante una interacción también puede controlarse mediante anulaciones a nivel de sistema.
Para escenarios que requieren conversaciones multilingües altamente dinámicas, pueden desplegarse en su lugar modelos de voz multilingües de mayor tamaño sobre infraestructura de GPU.
La arquitectura se optimiza, en función de la carga de trabajo, bien para la eficiencia en CPU con modelos específicos por idioma, bien para la máxima flexibilidad multilingüe con modelos basados en GPU.
Nota: tanto el STT multilingüe como el TTS multilingüe requieren infraestructura GPU. La ruta de voz solo en CPU se aplica a los modelos Mihu STT y Mihu TTS específicos por idioma.
La capa de razonamiento se ejecuta íntegramente dentro de su entorno con LLM open-weight: modelos cuyos pesos se publican de forma abierta y pueden funcionar totalmente sin conexión en su propio hardware, sin ningún enlace con el proveedor del modelo. Mihu evalúa continuamente nuevos modelos open-weight en lugar de vincular de forma permanente la pila on-premise a una única familia de modelos.
Los despliegues de LLM de alto rendimiento requieren por lo general infraestructura de GPU. El modelo recomendado puede cambiar a medida que aparecen nuevos modelos, y Mihu puede actualizar o sustituir el modelo de razonamiento con independencia del resto de la infraestructura de agentes.
La infraestructura es agnóstica al modelo. El mejor modelo disponible puede cambiar; su arquitectura no tiene por qué hacerlo.
El modelo de razonamiento se selecciona en el momento del despliegue a partir del conjunto de evaluación vigente. A septiembre de 2026, una de nuestras configuraciones de alto rendimiento preferidas es Kimi K2.6 Instant. Se ejecuta en infraestructura GPU dedicada, aprovisionada además de la base de 128 vCPU. Cuando existan requisitos de compra o de origen del modelo, pueden seleccionarse alternativas open-weight de otros proveedores y regiones, como Llama o Mistral. La selección se confirma en cada propuesta de despliegue.
Un despliegue completo de Mihu On-Premise consta de varios servicios independientes. Todos los componentes principales se entregan como servicios Docker en contenedores y se despliegan en Kubernetes con Rancher o Helm.
Runtime principal del agente de IA y lógica de negocio.
Coordina los modelos de voz, los LLM, los agentes y los servicios de ejecución.
Capa de comunicación en tiempo real entre los servicios y las sesiones de agente.
Gestiona la telefonía empresarial y la conectividad SIP.
Da soporte a cargas de trabajo de comunicación saliente y de alto volumen.
Ejecuta herramientas, integraciones y acciones del agente.
Interfaz de administración, configuración y gestión operativa.
Almacenamiento persistente de los datos de aplicación y operativos.
Estado en tiempo real, caché y coordinación distribuida en ejecución.
También pueden desplegarse on-premise capacidades adicionales de Mihu. Estos componentes requieren capacidad de servidor adicional en función del uso.
Para generar y ejecutar servicios, código, integraciones y flujos de trabajo personalizados. Ejecutar Builder requiere capacidad GPU adicional en el servidor.
Para exponer el espacio de trabajo y las capacidades de Mihu a sistemas de IA compatibles con MCP.
Conecta su PBX o sistema de telefonía existente con la infraestructura SIP de Mihu para llamadas entrantes y salientes.
Necesario si desea conectar el canal de correo electrónico. Los correos de los agentes y de notificación se envían a través de su propio servidor SMTP.
Los despliegues en producción deben incluir una infraestructura de observabilidad dedicada. Mihu recomienda una infraestructura independiente para el registro y la monitorización centralizados.
Los registros de Mihu Core, la orquestación, SIP, el relay, los servidores de modelos y los servicios de aplicación se recopilan de forma centralizada.
Las métricas de infraestructura y de aplicación se monitorizan de forma continua. Pueden generarse alertas cuando se superan los umbrales operativos predefinidos.
Todos los servicios de Mihu se ejecutan en servidores dentro de la propia red del cliente. Para la operación en producción no se requiere VPN, túnel ni conexión permanente con Mihu.
Los servicios internos de IA no necesitan exposición pública. La telefonía llega a la infraestructura SIP a través de la conectividad existente del cliente con su operador o PBX, y las reglas de red se definen íntegramente según las políticas de infraestructura y seguridad del cliente.
Para una instalación de Mihu On-Premise en producción, la configuración inicial de la infraestructura se determina en función de la concurrencia y las cargas de trabajo previstas.
La base de 128 vCPU cubre los servicios Mihu Core y el STT/TTS en CPU. No cubre la capa de razonamiento: un LLM autoalojado de alto rendimiento como Kimi K2.6 Instant requiere infraestructura GPU dedicada además de esta base, dimensionada según el modelo seleccionado y la concurrencia prevista. Si se selecciona un modelo open-weight más pequeño, la necesidad de GPU se reduce en consecuencia. También se añade capacidad GPU cuando se requieren modelos de voz multilingües en GPU. La asignación exacta depende de las conversaciones de IA simultáneas, la carga de STT/TTS, los idiomas desplegados, la elección del LLM, la configuración de redundancia y servicios adicionales como Builder y MCP.
La asignación de núcleos físicos frente a vCPU se confirma en la propuesta de despliegue.
Los requisitos de almacenamiento dependen principalmente de si las grabaciones de llamadas y otros contenidos multimedia se conservan localmente. Las bases de datos de la aplicación Mihu requieren almacenamiento persistente, mientras que la capacidad de grabación se calcula por separado. Los clientes que conserven meses o años de grabaciones deben aprovisionar un volumen de almacenamiento dedicado, dimensionado según su política de retención.
La arquitectura de producción puede configurarse con redundancia en los servicios críticos de Mihu. Alcanzar este objetivo exige mantener la arquitectura de producción, la redundancia y los requisitos de infraestructura acordados.
Para las instalaciones on-premise empresariales se asigna una responsabilidad operativa dedicada. Salvo fallos de la infraestructura o del hardware subyacentes ajenos a la responsabilidad operativa de Mihu, el despliegue está diseñado para alcanzar el objetivo acordado de 99.9% de disponibilidad del servicio. Las responsabilidades capa por capa se definen en el documento de SLA.
La pila completa de Mihu se proporciona como servicios Docker preconfigurados. El equipo de ingeniería de Mihu se encarga de la configuración del despliegue y de la preparación para producción junto con el equipo de infraestructura del cliente. Un despliegue on-premise típico se entrega en 3–6 meses, desde la preparación de la infraestructura hasta la producción, y está disponible para clientes empresariales.
Kubernetes: la pila puede desplegarse con charts de Helm. La vía estándar y más rápida de Mihu es un despliegue de Kubernetes gestionado con Rancher.
Mihu On-Premise utiliza versionado basado en ramas: cada despliegue de cliente se ejecuta en su propia rama de release y las actualizaciones se entregan como releases mensuales. Cada release se valida antes del despliegue y se aplica en coordinación con el equipo de infraestructura del cliente, de modo que las actualizaciones se programan en lugar de imponerse. La validación de cada release cubre el conjunto de pruebas estándar; algunas pruebas unitarias pueden variar en función de las personalizaciones específicas de cada cliente.
Para cada entorno on-premise, Mihu asigna un equipo de customer success y un equipo de DevOps que trabajan junto a su equipo. El soporte se canaliza a través de un grupo de Slack compartido, de modo que las consultas operativas, la coordinación de releases y las incidencias se gestionan directamente con las personas que conocen su despliegue.
Una vista de una sola página de qué se ejecuta y dónde en un despliegue de Mihu On-Premise.
La pila completa: Speech-to-Text, Text-to-Speech, clonación de voz, la capa de razonamiento con LLM, la orquestación, la telefonía SIP, el Action Server para las integraciones, la aplicación de gestión y las capas de base de datos y Redis. Los datos de sus clientes no tienen por qué salir de su entorno.
No para la capa de voz. El STT y el TTS se ejecutan en CPU con modelos de aproximadamente 66M a 143M de parámetros. Los LLM open-weight de alto rendimiento requieren por lo general infraestructura de GPU, y también se añade capacidad de GPU si opta por modelos de voz multilingües de mayor tamaño.
La pila de voz on-premise en CPU actual admite siete idiomas: inglés, alemán, francés, español, italiano, ruso y turco. Estos modelos Mihu STT y Mihu TTS específicos por idioma se ejecutan en CPU, sin GPU. Mihu STT alcanza normalmente una tasa de error de palabra (WER) de alrededor del 5–9 %; la cifra exacta depende del idioma y del conjunto de datos de evaluación.
La capa de razonamiento es agnóstica al modelo y ejecuta modelos open-weight. Mihu recomienda un modelo en la fecha del despliegue y, para cumplir requisitos de compra o de origen del modelo, pueden seleccionarse alternativas de otros proveedores y regiones, por ejemplo Llama o Mistral junto a Kimi K2.6 Instant. El modelo puede actualizarse o sustituirse con independencia del resto de la infraestructura de agentes a medida que aparecen mejores modelos open-weight.
Sí. Los modelos de STT y TTS compatibles pueden ajustarse sobre infraestructura controlada por el cliente utilizando sus propios conjuntos de datos, de modo que el audio propio nunca llega a un proveedor externo. Los modelos resultantes permanecen privados para su organización.
Una base de producción típica comienza en 128 vCPU para los servicios principales de Mihu y la capa de voz en CPU. El LLM autoalojado se dimensiona por separado y requiere infraestructura GPU dedicada además de esa base; también se añade capacidad GPU para modelos de voz multilingües en GPU. El almacenamiento se dimensiona según su política de retención de grabaciones y transcripciones. El dimensionamiento exacto se confirma en la propuesta de despliegue.
Todo se entrega como servicios Docker preconfigurados y se ejecuta en los propios servidores del cliente. Para la operación en producción no se requiere VPN ni conexión de retorno con Mihu, y ningún servicio interno de IA necesita exposición pública. El equipo de ingeniería de Mihu gestiona la configuración del despliegue junto con su equipo de infraestructura.
Sí. Se pueden añadir nuevos idiomas bajo petición. El esfuerzo de entrenamiento varía según el grupo lingüístico, y el STT y el TTS se entrenan por separado. Mihu puede proporcionar o adquirir el conjunto de datos de entrenamiento por usted, o trabajar con los datos que usted facilite. El entrenamiento se ejecuta en máquinas que usted proporciona o en infraestructura proporcionada por Mihu, y los modelos Mihu STT y Mihu TTS resultantes se despliegan después dentro de su entorno exactamente igual que los estándar.
Indíquenos su concurrencia prevista, los idiomas y los requisitos de residencia de datos. Nuestro equipo de ingeniería le responderá con una propuesta de dimensionamiento y un plan de despliegue.