A Mihu executa todo o stack de agentes de IA — da fala e do raciocínio à telefonia e às ações — dentro da sua infraestrutura. Os dados dos clientes não precisam sair do seu ambiente.
O Mihu AI On-Premise é uma oferta corporativa que permite que as organizações executem todo o stack de agentes da Mihu AI dentro da própria infraestrutura.
O processamento de fala, a inferência de IA, a orquestração, a telefonia, as integrações, os serviços de aplicação e o armazenamento de dados podem operar sem que os dados do cliente saiam do ambiente da organização.
Toda a implantação é entregue como serviços Docker em contêineres e executada em infraestrutura gerenciada pelo cliente, implantada em Kubernetes com Rancher ou Helm.
A Mihu fornece seus próprios modelos de voz — Mihu STT (Speech-to-Text) e Mihu TTS (Text-to-Speech) — totalmente on-premise. Para implantações compatíveis:
Esses 7 idiomas são executados inteiramente nos modelos STT e TTS próprios da Mihu, dentro da sua infraestrutura. A plataforma em nuvem da Mihu suporta mais de 40 idiomas por meio de modelos de voz adicionais.
A infraestrutura de fala da Mihu foi projetada para manter reduzidos os requisitos de inferência. Dependendo do idioma e da configuração do modelo, os modelos de fala implantados têm aproximadamente 66M – 143M de parâmetros.
Isso torna possível operar cargas de trabalho de STT e TTS em infraestrutura de CPU sem exigir GPUs dedicadas para cada carga de trabalho de voz.
Os números de simultaneidade são definidos por implantação, por meio de benchmarks no hardware de destino, e não são informados como uma proporção fixa de CPU por chamada.
Dados de fala proprietários e vozes da marca permanecem em uma infraestrutura sob seu controle.
Organizações com dados de fala proprietários de alta qualidade podem personalizar ainda mais a camada de fala. A Mihu pode realizar o fine-tuning dos modelos de STT/TTS compatíveis diretamente em infraestrutura controlada pelo cliente, de modo que conjuntos de dados proprietários não precisem ser transferidos para um provedor de inferência terceirizado.
Particularmente útil para organizações com vocabulário especializado, sotaques regionais ou requisitos rigorosos de residência de dados.
O Mihu On-Premise também oferece suporte à clonagem de voz privada. As amostras de voz fornecidas podem ser usadas para criar vozes específicas da organização, que passam a ser hospedadas dentro da própria infraestrutura do cliente.
Tanto as gravações de origem quanto o modelo de voz resultante podem permanecer privados.
Isso permite que as empresas criem vozes de marca consistentes sem depender de um provedor de TTS externo durante a inferência em produção.
Requisito da amostra de voz: aproximadamente 30 segundos de fala limpa, gravada sem pausas longas ou intervalos entre as frases.
Os modelos de fala leves para CPU são principalmente específicos por idioma, em vez de um único modelo multilíngue. Para agentes de IA que precisam alternar de idioma dinamicamente durante a mesma interação, a Mihu oferece suporte a diversas estratégias de implantação.
Vários modelos de fala específicos por idioma são executados simultaneamente. A camada de orquestração da Mihu detecta ou recebe o idioma ativo e roteia dinamicamente o processamento de fala para o modelo adequado.
A seleção do modelo durante uma interação também pode ser controlada por substituições em nível de sistema.
Para cenários que exigem conversas multilíngues altamente dinâmicas, é possível implantar modelos de fala multilíngues maiores em infraestrutura de GPU.
A arquitetura é otimizada, conforme a carga de trabalho, para eficiência em CPU com modelos específicos por idioma ou para máxima flexibilidade multilíngue com modelos baseados em GPU.
Nota: tanto o STT multilíngue quanto o TTS multilíngue exigem infraestrutura GPU. O caminho de voz apenas em CPU se aplica aos modelos Mihu STT e Mihu TTS específicos por idioma.
A camada de raciocínio roda inteiramente dentro do seu ambiente com LLMs open-weight: modelos cujos pesos são publicados abertamente e podem funcionar totalmente offline no seu próprio hardware, sem nenhuma conexão com o fornecedor do modelo. A Mihu avalia continuamente novos modelos open-weight em vez de vincular permanentemente o stack on-premise a uma única família de modelos.
Implantações de LLM de alto desempenho geralmente exigem infraestrutura de GPU. O modelo recomendado pode mudar à medida que novos modelos ficam disponíveis, e a Mihu pode atualizar ou substituir o modelo de raciocínio de forma independente do restante da infraestrutura de agentes.
A infraestrutura é independente de modelo. O melhor modelo disponível pode mudar; sua arquitetura não precisa mudar.
O modelo de raciocínio é selecionado no momento da implantação a partir do conjunto de avaliação atual. Em setembro de 2026, uma de nossas configurações de alto desempenho preferidas é o Kimi K2.6 Instant. Ele é executado em infraestrutura GPU dedicada, provisionada além da base de 128 vCPU. Quando houver requisitos de compra ou de origem do modelo, é possível escolher alternativas open-weight de outros fornecedores e regiões, como Llama ou Mistral. A seleção é confirmada em cada proposta de implantação.
Uma implantação completa do Mihu On-Premise consiste em vários serviços independentes. Todos os componentes principais são entregues como serviços Docker em contêineres e implantados em Kubernetes com Rancher ou Helm.
Runtime principal do agente de IA e regras de negócio.
Coordena modelos de fala, LLMs, agentes e serviços de runtime.
Camada de comunicação em tempo real entre os serviços e as sessões dos agentes.
Trata da telefonia corporativa e da conectividade SIP.
Dá suporte a cargas de trabalho de comunicação ativa e de alto volume.
Executa ferramentas, integrações e ações dos agentes.
Interface de administração, configuração e gestão operacional.
Armazenamento persistente de dados operacionais e da aplicação.
Estado em tempo real, cache e coordenação distribuída em tempo de execução.
Recursos adicionais da Mihu também podem ser implantados on-premise. Esses componentes exigem capacidade de servidor adicional conforme o uso.
Para gerar e executar serviços, código, integrações e fluxos de trabalho personalizados. Executar o Builder exige capacidade GPU adicional no servidor.
Para expor o workspace e os recursos da Mihu a sistemas de IA compatíveis com MCP.
Conecta seu PBX ou sistema de telefonia existente à infraestrutura SIP da Mihu para chamadas de entrada e saída.
Necessário se você quiser conectar o canal de e-mail. Os e-mails dos agentes e de notificação são enviados pelo seu próprio servidor SMTP.
Implantações em produção devem incluir uma infraestrutura de observabilidade dedicada. A Mihu recomenda uma infraestrutura separada para logs e monitoramento centralizados.
Os logs do Mihu Core, da orquestração, do SIP, do relay, dos servidores de modelos e dos serviços de aplicação são coletados de forma centralizada.
As métricas de infraestrutura e de aplicação são monitoradas continuamente. Alertas podem ser gerados quando limites operacionais predefinidos são ultrapassados.
Todos os serviços da Mihu são executados em servidores dentro da própria rede do cliente. Nenhuma VPN, túnel ou conexão permanente com a Mihu é necessária para a operação em produção.
Os serviços internos de IA não precisam de exposição pública. A telefonia chega à infraestrutura SIP pela conectividade existente do cliente com a operadora ou o PBX, e as regras de rede são definidas inteiramente pelas políticas de infraestrutura e segurança do cliente.
Para uma instalação do Mihu On-Premise em produção, a configuração inicial de infraestrutura é definida conforme a simultaneidade e as cargas de trabalho previstas.
A base de 128 vCPU cobre os serviços Mihu Core e o STT/TTS em CPU. Não cobre a camada de raciocínio: um LLM auto-hospedado de alto desempenho, como o Kimi K2.6 Instant, exige infraestrutura GPU dedicada além dessa base, dimensionada conforme o modelo selecionado e a concorrência esperada. A escolha de um modelo open-weight menor reduz proporcionalmente a necessidade de GPU. Capacidade GPU também é adicionada quando modelos de voz multilíngues em GPU são necessários. A alocação exata depende das conversas de IA simultâneas, da carga de STT/TTS, dos idiomas implantados, da escolha do LLM, da configuração de redundância e de serviços adicionais como Builder e MCP.
A alocação em núcleos físicos frente a vCPU é confirmada na proposta de implantação.
Os requisitos de armazenamento dependem principalmente de as gravações de chamadas e outras mídias serem retidas localmente. Os bancos de dados da aplicação Mihu exigem armazenamento persistente, enquanto a capacidade para gravações é calculada separadamente. Clientes que retêm meses ou anos de gravações devem provisionar um volume de armazenamento dedicado, dimensionado conforme sua política de retenção.
A arquitetura de produção pode ser configurada com redundância nos serviços críticos da Mihu. Atingir essa meta exige a manutenção da arquitetura de produção, da redundância e dos requisitos de infraestrutura acordados.
Para instalações on-premise corporativas, é atribuída uma responsabilidade operacional dedicada. Na ausência de falhas da infraestrutura subjacente ou de hardware fora da responsabilidade operacional da Mihu, a implantação é projetada para atingir a meta acordada de 99.9% de disponibilidade do serviço. As responsabilidades camada a camada são definidas no documento de SLA.
Todo o stack da Mihu é fornecido como serviços Docker pré-configurados. O time de engenharia da Mihu cuida da configuração da implantação e do preparo para produção junto com o time de infraestrutura do cliente. Uma implantação on-premise típica é entregue em 3–6 meses, da preparação da infraestrutura até a produção, e está disponível para clientes corporativos.
Kubernetes: o stack pode ser implantado com charts do Helm. O caminho padrão e mais rápido da Mihu é uma implantação de Kubernetes gerenciada pelo Rancher.
O Mihu On-Premise usa versionamento baseado em branches: cada implantação de cliente é executada em sua própria branch de release e as atualizações são entregues como releases mensais. Cada release é validada antes da implantação e aplicada em coordenação com a equipe de infraestrutura do cliente, de modo que as atualizações são agendadas, não impostas. A validação da release cobre a suíte de testes padrão; alguns testes unitários podem variar conforme as personalizações específicas de cada cliente.
Para cada ambiente on-premise, a Mihu designa um time de customer success e um time de DevOps para atuar ao lado do seu time. O suporte acontece por meio de um grupo compartilhado no Slack, de modo que dúvidas operacionais, coordenação de releases e incidentes são tratados diretamente com as pessoas que conhecem a sua implantação.
Uma visão em uma página do que roda e onde em uma implantação do Mihu On-Premise.
Todo o stack: Speech-to-Text, Text-to-Speech, clonagem de voz, a camada de raciocínio com LLM, a orquestração, a telefonia SIP, o Action Server para integrações, a aplicação de gestão e as camadas de banco de dados e Redis. Os dados dos clientes não precisam sair do seu ambiente.
Não para a camada de fala. STT e TTS rodam em CPU com modelos de aproximadamente 66M a 143M de parâmetros. LLMs open-weight de alto desempenho geralmente exigem infraestrutura de GPU, e capacidade de GPU também é acrescentada se você optar por modelos de fala multilíngues maiores.
O stack de voz on-premise em CPU atual suporta sete idiomas: inglês, alemão, francês, espanhol, italiano, russo e turco. Esses modelos Mihu STT e Mihu TTS específicos por idioma são executados em CPU, sem GPUs. O Mihu STT normalmente atinge cerca de 5–9% de Word Error Rate (WER); o valor exato depende do idioma e do conjunto de dados de avaliação.
A camada de raciocínio é independente de modelo e executa modelos open-weight. A Mihu recomenda um modelo na data da implantação e, para atender a requisitos de compra ou de origem do modelo, é possível escolher alternativas de outros fornecedores e regiões, por exemplo Llama ou Mistral ao lado do Kimi K2.6 Instant. O modelo pode ser atualizado ou substituído de forma independente do restante da infraestrutura de agentes à medida que surgem modelos open-weight melhores.
Sim. Os modelos de STT e TTS compatíveis podem passar por fine-tuning em infraestrutura controlada pelo cliente usando seus próprios conjuntos de dados, de modo que o áudio proprietário nunca vá para um provedor terceirizado. Os modelos resultantes permanecem privados para a sua organização.
Uma base de produção típica começa em 128 vCPU para os serviços principais da Mihu e a camada de voz em CPU. O LLM auto-hospedado é dimensionado separadamente e exige infraestrutura GPU dedicada além dessa base; capacidade GPU também é adicionada para modelos de voz multilíngues em GPU. O armazenamento é dimensionado conforme sua política de retenção de gravações e transcrições. O dimensionamento exato é confirmado na proposta de implantação.
Tudo é entregue como serviços Docker pré-configurados e executado nos próprios servidores do cliente. Nenhuma VPN ou conexão de retorno com a Mihu é necessária para a operação em produção, e nenhum serviço interno de IA precisa de exposição pública. A equipe de engenharia da Mihu cuida da configuração da implantação junto com a sua equipe de infraestrutura.
Sim. Novos idiomas podem ser adicionados sob demanda. O esforço de treinamento varia conforme o grupo linguístico, e STT e TTS são treinados separadamente. A Mihu pode fornecer ou adquirir o conjunto de dados de treinamento para você, ou trabalhar com os dados que você fornecer. O treinamento é executado em máquinas fornecidas por você ou em infraestrutura fornecida pela Mihu, e os modelos Mihu STT e Mihu TTS resultantes são então implantados dentro do seu ambiente exatamente como os padrão.
Informe a simultaneidade prevista, os idiomas e os requisitos de residência de dados. Nosso time de engenharia retornará com uma proposta de dimensionamento e um plano de implantação.