# Implantação On-Premise — Mihu AI

Mihu AI On-Premise

# Seus agentes. Seus modelos. Suas vozes. Sua infraestrutura. Seus dados.

A Mihu executa todo o stack de agentes de IA — da fala e do raciocínio à telefonia e às ações — dentro da sua infraestrutura. Os dados dos clientes não precisam sair do seu ambiente.

Fale com o time de vendas (https://mihu.ai/pt/contact) Requisitos de implantação (https://mihu.ai/pt/on-premise#requirements)

7

Idiomas de fala on-premise

CPU

Inferência Mihu STT e TTS

99.9%

Meta de disponibilidade

Limite da implantação

Dentro da sua rede

Telefonia

Infraestrutura SIP, serviços de broadcast

Local

Fala

Mihu STT, Mihu TTS e clonagem de voz em CPU

Local

Raciocínio

LLM open-weight, auto-hospedado

Local

Ações

Action Server, integrações, fluxos de trabalho

Local

Dados

Banco de dados, Redis, gravações, transcrições

Local

Entregue como serviços Docker em contêineres em infraestrutura gerenciada pelo cliente, implantado em Kubernetes com Rancher ou Helm.

Visão geral

## Infraestrutura privada de voz com IA, implantada inteiramente dentro do seu ambiente.

O Mihu AI On-Premise é uma oferta corporativa que permite que as organizações executem todo o stack de agentes da Mihu AI dentro da própria infraestrutura.

O processamento de fala, a inferência de IA, a orquestração, a telefonia, as integrações, os serviços de aplicação e o armazenamento de dados podem operar sem que os dados do cliente saiam do ambiente da organização.

Toda a implantação é entregue como serviços Docker em contêineres e executada em infraestrutura gerenciada pelo cliente, implantada em Kubernetes com Rancher ou Helm.

Fala

On-premise, inferência em CPU

LLM

Pesos abertos, auto-hospedado

Telefonia

SIP dentro da sua rede

Dados

Armazenamento controlado pelo cliente

Infraestrutura de fala

## Mihu STT e Mihu TTS, totalmente on-premise.

A Mihu fornece seus próprios modelos de voz — Mihu STT (Speech-to-Text) e Mihu TTS (Text-to-Speech) — totalmente on-premise. Para implantações compatíveis:

O Mihu STT (Speech-to-Text) é executado localmente.

O Mihu TTS (Text-to-Speech) é executado localmente.

A camada de fala oferece suporte a inferência exclusivamente em CPU.

Nenhuma API de fala externa é necessária.

A clonagem de voz pode ser implantada dentro da infraestrutura do cliente.

O áudio e os dados de treinamento do cliente podem permanecer integralmente dentro do ambiente do cliente.

Stack de fala on-premise atual · 7 idiomas

Inglês Alemão Francês Espanhol Italiano Russo Turco

Esses 7 idiomas são executados inteiramente nos modelos STT e TTS próprios da Mihu, dentro da sua infraestrutura. A plataforma em nuvem da Mihu suporta mais de 40 idiomas por meio de modelos de voz adicionais.

5–9%

Word Error Rate (WER) típico das implantações atuais do Mihu STT (Speech-to-Text), conforme o idioma e o conjunto de dados de avaliação.

### Modelos de fala leves para CPU

A infraestrutura de fala da Mihu foi projetada para manter reduzidos os requisitos de inferência. Dependendo do idioma e da configuração do modelo, os modelos de fala implantados têm aproximadamente 66M – 143M de parâmetros.

Isso torna possível operar cargas de trabalho de STT e TTS em infraestrutura de CPU sem exigir GPUs dedicadas para cada carga de trabalho de voz.

A capacidade real depende de

conversas simultâneas

idioma selecionado

modelo de STT/TTS selecionado

configuração de áudio

meta de latência

requisitos de redundância

Os números de simultaneidade são definidos por implantação, por meio de benchmarks no hardware de destino, e não são informados como uma proporção fixa de CPU por chamada.

Personalização

## Fine-tuning privado e clonagem de voz

Dados de fala proprietários e vozes da marca permanecem em uma infraestrutura sob seu controle.

### Fine-tuning privado

Organizações com dados de fala proprietários de alta qualidade podem personalizar ainda mais a camada de fala. A Mihu pode realizar o fine-tuning dos modelos de STT/TTS compatíveis diretamente em infraestrutura controlada pelo cliente, de modo que conjuntos de dados proprietários não precisem ser transferidos para um provedor de inferência terceirizado.

Os modelos personalizados podem ser

ajustados com conjuntos de dados fornecidos pelo cliente

otimizados para a terminologia específica do setor

adaptados a sotaques e à linguagem específica do domínio

implantados exclusivamente dentro da infraestrutura do cliente

mantidos privados, inteiramente dentro da sua própria infraestrutura

Particularmente útil para organizações com vocabulário especializado, sotaques regionais ou requisitos rigorosos de residência de dados.

### Clonagem de voz

O Mihu On-Premise também oferece suporte à clonagem de voz privada. As amostras de voz fornecidas podem ser usadas para criar vozes específicas da organização, que passam a ser hospedadas dentro da própria infraestrutura do cliente.

Tanto as gravações de origem quanto o modelo de voz resultante podem permanecer privados.

Isso permite que as empresas criem vozes de marca consistentes sem depender de um provedor de TTS externo durante a inferência em produção.

Requisito da amostra de voz: aproximadamente 30 segundos de fala limpa, gravada sem pausas longas ou intervalos entre as frases.

Arquitetura multi-idioma

## Específico por idioma em CPU ou multilíngue em GPU

Os modelos de fala leves para CPU são principalmente específicos por idioma, em vez de um único modelo multilíngue. Para agentes de IA que precisam alternar de idioma dinamicamente durante a mesma interação, a Mihu oferece suporte a diversas estratégias de implantação.

Eficiência em CPU

### Orquestração de modelos

Vários modelos de fala específicos por idioma são executados simultaneamente. A camada de orquestração da Mihu detecta ou recebe o idioma ativo e roteia dinamicamente o processamento de fala para o modelo adequado.

A seleção do modelo durante uma interação também pode ser controlada por substituições em nível de sistema.

Máxima flexibilidade multilíngue

### Modelos multilíngues em GPU

Para cenários que exigem conversas multilíngues altamente dinâmicas, é possível implantar modelos de fala multilíngues maiores em infraestrutura de GPU.

A arquitetura é otimizada, conforme a carga de trabalho, para eficiência em CPU com modelos específicos por idioma ou para máxima flexibilidade multilíngue com modelos baseados em GPU.

Nota: tanto o STT multilíngue quanto o TTS multilíngue exigem infraestrutura GPU. O caminho de voz apenas em CPU se aplica aos modelos Mihu STT e Mihu TTS específicos por idioma.

Infraestrutura de LLM local

## A camada de raciocínio roda em modelos open-weight dentro do seu ambiente.

A camada de raciocínio roda inteiramente dentro do seu ambiente com LLMs open-weight: modelos cujos pesos são publicados abertamente e podem funcionar totalmente offline no seu próprio hardware, sem nenhuma conexão com o fornecedor do modelo. A Mihu avalia continuamente novos modelos open-weight em vez de vincular permanentemente o stack on-premise a uma única família de modelos.

Implantações de LLM de alto desempenho geralmente exigem infraestrutura de GPU. O modelo recomendado pode mudar à medida que novos modelos ficam disponíveis, e a Mihu pode atualizar ou substituir o modelo de raciocínio de forma independente do restante da infraestrutura de agentes.

A infraestrutura é independente de modelo. O melhor modelo disponível pode mudar; sua arquitetura não precisa mudar.

Configuração recomendada na data da implantação

O modelo de raciocínio é selecionado no momento da implantação a partir do conjunto de avaliação atual. Em setembro de 2026, uma de nossas configurações de alto desempenho preferidas é o Kimi K2.6 Instant. Ele é executado em infraestrutura GPU dedicada, provisionada além da base de 128 vCPU. Quando houver requisitos de compra ou de origem do modelo, é possível escolher alternativas open-weight de outros fornecedores e regiões, como Llama ou Mistral. A seleção é confirmada em cada proposta de implantação.

Infraestrutura Mihu Core

## Do que é composta uma implantação completa

Uma implantação completa do Mihu On-Premise consiste em vários serviços independentes. Todos os componentes principais são entregues como serviços Docker em contêineres e implantados em Kubernetes com Rancher ou Helm.

01

### Mihu Core

Runtime principal do agente de IA e regras de negócio.

02

### Mihu Orchestration

Coordena modelos de fala, LLMs, agentes e serviços de runtime.

03

### Mihu Relay

Camada de comunicação em tempo real entre os serviços e as sessões dos agentes.

04

### Infraestrutura SIP

Trata da telefonia corporativa e da conectividade SIP.

05

### Serviços de broadcast

Dá suporte a cargas de trabalho de comunicação ativa e de alto volume.

06

### Action Server

Executa ferramentas, integrações e ações dos agentes.

07

### Gestão / Aplicação web

Interface de administração, configuração e gestão operacional.

08

### Infraestrutura de banco de dados

Armazenamento persistente de dados operacionais e da aplicação.

09

### Infraestrutura Redis

Estado em tempo real, cache e coordenação distribuída em tempo de execução.

### Infraestrutura opcional

Recursos adicionais da Mihu também podem ser implantados on-premise. Esses componentes exigem capacidade de servidor adicional conforme o uso.

### Mihu Builder

Para gerar e executar serviços, código, integrações e fluxos de trabalho personalizados. Executar o Builder exige capacidade GPU adicional no servidor.

### Mihu MCP Server

Para expor o workspace e os recursos da Mihu a sistemas de IA compatíveis com MCP.

### PBX Connector Server

Conecta seu PBX ou sistema de telefonia existente à infraestrutura SIP da Mihu para chamadas de entrada e saída.

### Servidor SMTP

Necessário se você quiser conectar o canal de e-mail. Os e-mails dos agentes e de notificação são enviados pelo seu próprio servidor SMTP.

Observabilidade e logs

## Observabilidade dedicada para implantações em produção

Implantações em produção devem incluir uma infraestrutura de observabilidade dedicada. A Mihu recomenda uma infraestrutura separada para logs e monitoramento centralizados.

### Logs centralizados

Os logs do Mihu Core, da orquestração, do SIP, do relay, dos servidores de modelos e dos serviços de aplicação são coletados de forma centralizada.

### Monitoramento

As métricas de infraestrutura e de aplicação são monitoradas continuamente. Alertas podem ser gerados quando limites operacionais predefinidos são ultrapassados.

Métricas monitoradas

Uso de CPU

Uso de memória

Uso de GPU

Capacidade de disco

Saúde da rede

Saúde dos serviços

Latência de inferência dos modelos

Profundidade das filas

Infraestrutura de chamadas

Erros da aplicação

Arquitetura de rede

## Nenhuma conectividade externa necessária

Todos os serviços da Mihu são executados em servidores dentro da própria rede do cliente. Nenhuma VPN, túnel ou conexão permanente com a Mihu é necessária para a operação em produção.

Os serviços internos de IA não precisam de exposição pública. A telefonia chega à infraestrutura SIP pela conectividade existente do cliente com a operadora ou o PBX, e as regras de rede são definidas inteiramente pelas políticas de infraestrutura e segurança do cliente.

Rede do cliente

Pontos de entrada SIP trunk / PBX App web API

Core / Orquestração / SIP

STT LLM TTS Ações

DB / Cache / Armazenamento

Operações Logs Notificações Monitoramento

Requisitos de infraestrutura

## Baseline de produção

Para uma instalação do Mihu On-Premise em produção, a configuração inicial de infraestrutura é definida conforme a simultaneidade e as cargas de trabalho previstas.

### Computação

128 vCPU

Mínimo recomendado · serviços principais e camada de voz em CPU

+ GPU

Conforme o modelo selecionado · ex. Kimi K2.6 Instant, Qwen, Llama ou Mistral; o modelo recomendado pode mudar com o tempo

A base de 128 vCPU cobre os serviços Mihu Core e o STT/TTS em CPU. Não cobre a camada de raciocínio: um LLM auto-hospedado de alto desempenho, como o Kimi K2.6 Instant, exige infraestrutura GPU dedicada além dessa base, dimensionada conforme o modelo selecionado e a concorrência esperada. A escolha de um modelo open-weight menor reduz proporcionalmente a necessidade de GPU. Capacidade GPU também é adicionada quando modelos de voz multilíngues em GPU são necessários. A alocação exata depende das conversas de IA simultâneas, da carga de STT/TTS, dos idiomas implantados, da escolha do LLM, da configuração de redundância e de serviços adicionais como Builder e MCP.

A alocação em núcleos físicos frente a vCPU é confirmada na proposta de implantação.

### Armazenamento

chamadas × duração média × formato de gravação × período de retenção

Capacidade para gravações

Os requisitos de armazenamento dependem principalmente de as gravações de chamadas e outras mídias serem retidas localmente. Os bancos de dados da aplicação Mihu exigem armazenamento persistente, enquanto a capacidade para gravações é calculada separadamente. Clientes que retêm meses ou anos de gravações devem provisionar um volume de armazenamento dedicado, dimensionado conforme sua política de retenção.

Os clientes definem suas próprias políticas de

retenção de gravações

retenção de transcrições

backup

arquivamento

exclusão

### Alta disponibilidade

99.9%

Meta de disponibilidade operacional

A arquitetura de produção pode ser configurada com redundância nos serviços críticos da Mihu. Atingir essa meta exige a manutenção da arquitetura de produção, da redundância e dos requisitos de infraestrutura acordados.

Para instalações on-premise corporativas, é atribuída uma responsabilidade operacional dedicada. Na ausência de falhas da infraestrutura subjacente ou de hardware fora da responsabilidade operacional da Mihu, a implantação é projetada para atingir a meta acordada de 99.9% de disponibilidade do serviço. As responsabilidades camada a camada são definidas no documento de SLA.

Implantação

## Pré-configurado, em contêineres Docker e entregue junto com o seu time de infraestrutura

Todo o stack da Mihu é fornecido como serviços Docker pré-configurados. O time de engenharia da Mihu cuida da configuração da implantação e do preparo para produção junto com o time de infraestrutura do cliente. Uma implantação on-premise típica é entregue em 3–6 meses, da preparação da infraestrutura até a produção, e está disponível para clientes corporativos.

Preparação da infraestrutura

Configuração de rede

Serviços Mihu

Modelos de fala

LLM

Telefonia

Armazenamento

Observabilidade

Validação

Produção

Kubernetes: o stack pode ser implantado com charts do Helm. O caminho padrão e mais rápido da Mihu é uma implantação de Kubernetes gerenciada pelo Rancher.

### Versionamento e releases

O Mihu On-Premise usa versionamento baseado em branches: cada implantação de cliente é executada em sua própria branch de release e as atualizações são entregues como releases mensais. Cada release é validada antes da implantação e aplicada em coordenação com a equipe de infraestrutura do cliente, de modo que as atualizações são agendadas, não impostas. A validação da release cobre a suíte de testes padrão; alguns testes unitários podem variar conforme as personalizações específicas de cada cliente.

### Time de suporte dedicado

Para cada ambiente on-premise, a Mihu designa um time de customer success e um time de DevOps para atuar ao lado do seu time. O suporte acontece por meio de um grupo compartilhado no Slack, de modo que dúvidas operacionais, coordenação de releases e incidentes são tratados diretamente com as pessoas que conhecem a sua implantação.

## Tudo permanece dentro.

Uma visão em uma página do que roda e onde em uma implantação do Mihu On-Premise.

Fala On-premise

Mihu STT CPU

Mihu TTS CPU

Clonagem de voz Privada

LLM Pesos abertos / auto-hospedado

Fine-tuning Na infraestrutura do cliente

Telefonia SIP

Dados Controlados pelo cliente

Gravações Controladas pelo cliente

Banco de dados On-premise

Integrações Action Server on-premise

Implantação Em contêineres Docker · Kubernetes (Rancher / Helm)

Conectividade Dentro da rede do cliente

Observabilidade Dedicada

Meta de SLA 99.9%

Entrega 3–6 meses até a produção

Disponibilidade Clientes corporativos

Suporte Time de customer success + DevOps, grupo compartilhado no Slack

Releases Mensais, versionamento por branch

FAQ

## Mihu AI On-Premise — Perguntas frequentes

O que realmente roda dentro da nossa infraestrutura?

Todo o stack: Speech-to-Text, Text-to-Speech, clonagem de voz, a camada de raciocínio com LLM, a orquestração, a telefonia SIP, o Action Server para integrações, a aplicação de gestão e as camadas de banco de dados e Redis. Os dados dos clientes não precisam sair do seu ambiente.

Precisamos de GPUs?

Não para a camada de fala. STT e TTS rodam em CPU com modelos de aproximadamente 66M a 143M de parâmetros. LLMs open-weight de alto desempenho geralmente exigem infraestrutura de GPU, e capacidade de GPU também é acrescentada se você optar por modelos de fala multilíngues maiores.

Quais idiomas o stack de fala on-premise suporta?

O stack de voz on-premise em CPU atual suporta sete idiomas: inglês, alemão, francês, espanhol, italiano, russo e turco. Esses modelos Mihu STT e Mihu TTS específicos por idioma são executados em CPU, sem GPUs. O Mihu STT normalmente atinge cerca de 5–9% de Word Error Rate (WER); o valor exato depende do idioma e do conjunto de dados de avaliação.

Qual LLM é utilizado e ele pode ser trocado depois?

A camada de raciocínio é independente de modelo e executa modelos open-weight. A Mihu recomenda um modelo na data da implantação e, para atender a requisitos de compra ou de origem do modelo, é possível escolher alternativas de outros fornecedores e regiões, por exemplo Llama ou Mistral ao lado do Kimi K2.6 Instant. O modelo pode ser atualizado ou substituído de forma independente do restante da infraestrutura de agentes à medida que surgem modelos open-weight melhores.

Podemos fazer fine-tuning dos modelos de fala com nossos próprios dados?

Sim. Os modelos de STT e TTS compatíveis podem passar por fine-tuning em infraestrutura controlada pelo cliente usando seus próprios conjuntos de dados, de modo que o áudio proprietário nunca vá para um provedor terceirizado. Os modelos resultantes permanecem privados para a sua organização.

De que infraestrutura precisamos para começar?

Uma base de produção típica começa em 128 vCPU para os serviços principais da Mihu e a camada de voz em CPU. O LLM auto-hospedado é dimensionado separadamente e exige infraestrutura GPU dedicada além dessa base; capacidade GPU também é adicionada para modelos de voz multilíngues em GPU. O armazenamento é dimensionado conforme sua política de retenção de gravações e transcrições. O dimensionamento exato é confirmado na proposta de implantação.

Como a implantação é entregue e conectada?

Tudo é entregue como serviços Docker pré-configurados e executado nos próprios servidores do cliente. Nenhuma VPN ou conexão de retorno com a Mihu é necessária para a operação em produção, e nenhum serviço interno de IA precisa de exposição pública. A equipe de engenharia da Mihu cuida da configuração da implantação junto com a sua equipe de infraestrutura.

Vocês podem treinar STT e TTS para um idioma fora dos sete atuais?

Sim. Novos idiomas podem ser adicionados sob demanda. O esforço de treinamento varia conforme o grupo linguístico, e STT e TTS são treinados separadamente. A Mihu pode fornecer ou adquirir o conjunto de dados de treinamento para você, ou trabalhar com os dados que você fornecer. O treinamento é executado em máquinas fornecidas por você ou em infraestrutura fornecida pela Mihu, e os modelos Mihu STT e Mihu TTS resultantes são então implantados dentro do seu ambiente exatamente como os padrão.

## Planejando uma implantação on-premise?

Informe a simultaneidade prevista, os idiomas e os requisitos de residência de dados. Nosso time de engenharia retornará com uma proposta de dimensionamento e um plano de implantação.

Fale com o time de vendas (https://mihu.ai/pt/contact)
