# Развёртывание On-Premise — Mihu AI

Mihu AI On-Premise

# Ваши агенты. Ваши модели. Ваши голоса. Ваша инфраструктура. Ваши данные.

Mihu разворачивает полный стек ИИ-агентов — от распознавания речи и рассуждений до телефонии и действий — внутри вашей инфраструктуры. Данные клиентов не обязаны покидать вашу среду.

Связаться с отделом продаж (https://mihu.ai/ru/contact) Требования к развёртыванию (https://mihu.ai/ru/on-premise#requirements)

7

Языков речи on-premise

CPU

Инференс Mihu STT и TTS

99.9%

Целевой уровень доступности

Границы развёртывания

Внутри вашей сети

Телефония

SIP-инфраструктура, сервисы массовых рассылок

Локально

Речь

Mihu STT, Mihu TTS и клонирование голоса на CPU

Локально

Рассуждения

LLM с открытыми весами, self-hosted

Локально

Действия

Action Server, интеграции, рабочие процессы

Локально

Данные

База данных, Redis, записи, расшифровки

Локально

Поставляется в виде контейнеризированных Docker-сервисов на инфраструктуре заказчика, развёрнутых в Kubernetes с помощью Rancher или Helm.

Обзор

## Приватная голосовая ИИ-инфраструктура, полностью развёрнутая в вашей среде.

Mihu AI On-Premise — это корпоративное предложение, которое позволяет организациям запускать полный стек ИИ-агентов Mihu в собственной инфраструктуре.

Обработка речи, ИИ-инференс, оркестрация, телефония, интеграции, прикладные сервисы и хранение данных могут работать так, что данные клиентов не покидают среду организации.

Всё развёртывание поставляется в виде контейнеризированных Docker-сервисов и работает на инфраструктуре, управляемой заказчиком, в Kubernetes с помощью Rancher или Helm.

Речь

On-premise, инференс на CPU

LLM

Открытые веса, self-hosted

Телефония

SIP внутри вашей сети

Данные

Хранение под контролем клиента

Речевая инфраструктура

## Mihu STT и Mihu TTS — полностью on-premise.

Mihu предоставляет собственные речевые модели — Mihu STT (Speech-to-Text) и Mihu TTS (Text-to-Speech) — полностью on-premise. Для поддерживаемых развёртываний:

Mihu STT (Speech-to-Text) работает локально.

Mihu TTS (Text-to-Speech) работает локально.

Для речевого слоя поддерживается инференс исключительно на CPU.

Внешний речевой API не требуется.

Клонирование голоса может быть развёрнуто внутри инфраструктуры клиента.

Аудиоданные и обучающие данные клиента могут полностью оставаться в среде клиента.

Текущий речевой стек on-premise · 7 языков

Английский Немецкий Французский Испанский Итальянский Русский Турецкий

Эти 7 языков полностью работают на собственных STT- и TTS-моделях Mihu внутри вашей инфраструктуры. Облачная платформа Mihu поддерживает более 40 языков за счёт дополнительных речевых моделей.

5–9%

Типичная доля ошибочных слов (WER) в текущих развёртываниях Mihu STT (Speech-to-Text) — в зависимости от языка и оценочного набора данных.

### Лёгкие речевые модели для CPU

Речевая инфраструктура Mihu спроектирована так, чтобы требования к инференсу оставались небольшими. В зависимости от языка и конфигурации модели развёртываемые речевые модели содержат примерно 66M – 143M параметров.

Это позволяет выполнять задачи STT и TTS на CPU-инфраструктуре, не требуя выделенного GPU для каждой голосовой нагрузки.

Фактическая ёмкость зависит от

одновременных разговоров

выбранного языка

выбранной модели STT/TTS

конфигурации аудио

целевой задержки

требований к резервированию

Показатели параллельной нагрузки определяются для каждого развёртывания посредством тестирования на целевом оборудовании и не указываются как фиксированное соотношение CPU к числу вызовов.

Кастомизация

## Приватный fine-tuning и клонирование голоса

Собственные речевые данные и брендовые голоса остаются на инфраструктуре, которую контролируете Вы.

### Приватный fine-tuning

Организации, располагающие качественными собственными речевыми данными, могут дополнительно адаптировать речевой слой. Mihu может выполнить fine-tuning поддерживаемых моделей STT/TTS непосредственно на инфраструктуре, контролируемой клиентом, чтобы проприетарные наборы данных не передавались стороннему поставщику инференса.

Пользовательские модели могут быть

дообучены на наборах данных, предоставленных клиентом

оптимизированы под отраслевую терминологию

адаптированы под акценты и предметно-специфичную речь

развёрнуты исключительно внутри инфраструктуры клиента

остаются приватными, полностью в вашей собственной инфраструктуре

Особенно полезно для организаций со специализированной лексикой, региональными акцентами или строгими требованиями к резидентности данных.

### Клонирование голоса

Mihu On-Premise также поддерживает приватное клонирование голоса. Предоставленные образцы голоса могут использоваться для создания голосов, специфичных для организации, которые затем размещаются в собственной инфраструктуре клиента.

Как исходные записи, так и полученная голосовая модель могут оставаться приватными.

Это позволяет предприятиям создавать единообразные брендовые голоса, не полагаясь на внешнего поставщика TTS во время промышленного инференса.

Требование к образцу голоса: около 30 секунд чистой речи, записанной без длинных пауз и промежутков между предложениями.

Многоязычная архитектура

## Языковые модели на CPU или многоязычные на GPU

Лёгкие речевые модели для CPU в основном специфичны для отдельного языка, а не представляют собой единую многоязычную модель. Для ИИ-агентов, которым необходимо динамически переключать языки в рамках одного взаимодействия, Mihu поддерживает несколько стратегий развёртывания.

Эффективность CPU

### Оркестрация моделей

Несколько языковых речевых моделей работают одновременно. Слой оркестрации Mihu определяет или получает активный язык и динамически направляет обработку речи в соответствующую модель.

Выбором модели можно также управлять с помощью системных переопределений во время взаимодействия.

Максимальная многоязычная гибкость

### Многоязычные модели на GPU

Для сценариев, требующих высокодинамичных многоязычных разговоров, вместо этого могут быть развёрнуты более крупные многоязычные речевые модели на GPU-инфраструктуре.

Архитектура оптимизируется либо под эффективность CPU с языковыми моделями, либо под максимальную многоязычную гибкость с моделями на GPU — в зависимости от характера нагрузки.

Примечание: многоязычные STT и TTS требуют GPU-инфраструктуры. Режим только на CPU относится к языковым моделям Mihu STT и Mihu TTS.

Локальная LLM-инфраструктура

## Слой рассуждений работает на моделях с открытыми весами внутри вашей среды.

Слой рассуждений работает полностью в вашей среде на LLM с открытыми весами: это модели, веса которых опубликованы публично и которые могут работать полностью офлайн на вашем собственном оборудовании, без какого-либо соединения с поставщиком модели. Mihu постоянно оценивает новые модели с открытыми весами, вместо того чтобы навсегда привязывать on-premise стек к одному семейству моделей.

Высокопроизводительные развёртывания LLM, как правило, требуют GPU-инфраструктуры. Рекомендуемая модель может меняться по мере появления новых моделей, и Mihu может обновить или заменить модель рассуждений независимо от остальной инфраструктуры агентов.

Инфраструктура не зависит от конкретной модели. Лучшая доступная модель может меняться; вашей архитектуре меняться не обязательно.

Рекомендуемая конфигурация на дату развёртывания

Модель рассуждений выбирается на момент развёртывания из текущего набора для оценки. По состоянию на сентябрь 2026 года одна из наших предпочтительных высокопроизводительных конфигураций — Kimi K2.6 Instant. Она работает на выделенной GPU-инфраструктуре, выделяемой в дополнение к базе в 128 vCPU. Там, где действуют требования к закупкам или к происхождению модели, могут быть выбраны альтернативы с открытыми весами от других поставщиков и из других регионов, например Llama или Mistral. Выбор подтверждается в каждом предложении по развёртыванию.

Инфраструктура Mihu Core

## Из чего состоит полное развёртывание

Полное развёртывание Mihu On-Premise состоит из нескольких независимых сервисов. Все базовые компоненты поставляются в виде контейнеризированных Docker-сервисов и развёртываются в Kubernetes с помощью Rancher или Helm.

01

### Mihu Core

Основная среда выполнения ИИ-агентов и бизнес-логика.

02

### Mihu Orchestration

Координирует речевые модели, LLM, агентов и сервисы среды выполнения.

03

### Mihu Relay

Слой обмена данными в реальном времени между сервисами и сессиями агентов.

04

### SIP-инфраструктура

Обеспечивает корпоративную телефонию и SIP-подключение.

05

### Сервисы массовых рассылок

Поддерживает исходящие коммуникации и нагрузки большого объёма.

06

### Action Server

Выполняет инструменты, интеграции и действия агентов.

07

### Управление / веб-приложение

Интерфейс администрирования, настройки и оперативного управления.

08

### Инфраструктура баз данных

Постоянное хранение прикладных и операционных данных.

09

### Инфраструктура Redis

Состояние в реальном времени, кеширование и распределённая координация среды выполнения.

### Дополнительная инфраструктура

Дополнительные возможности Mihu также могут быть развёрнуты on-premise. Эти компоненты требуют дополнительной серверной мощности в зависимости от объёма использования.

### Mihu Builder

Для генерации и запуска собственных сервисов, кода, интеграций и рабочих процессов. Для работы Builder требуются дополнительные GPU-мощности на сервере.

### Mihu MCP Server

Для предоставления рабочего пространства и возможностей Mihu ИИ-системам, совместимым с MCP.

### PBX Connector Server

Подключает вашу существующую АТС (PBX) или телефонную систему к SIP-инфраструктуре Mihu для входящих и исходящих звонков.

### SMTP-сервер

Требуется, если вы хотите подключить email-канал. Письма агентов и уведомления отправляются через ваш собственный SMTP-сервер.

Наблюдаемость и логирование

## Выделенная наблюдаемость для промышленных развёртываний

Промышленные развёртывания должны включать выделенную инфраструктуру наблюдаемости. Mihu рекомендует отдельную инфраструктуру для централизованного логирования и мониторинга.

### Централизованное логирование

Логи Mihu Core, оркестрации, SIP, relay, серверов моделей и прикладных сервисов собираются централизованно.

### Мониторинг

Инфраструктурные и прикладные метрики отслеживаются непрерывно. При превышении заранее заданных эксплуатационных порогов могут формироваться оповещения.

Отслеживаемые метрики

Загрузка CPU

Использование памяти

Загрузка GPU

Объём дискового пространства

Состояние сети

Состояние сервисов

Задержка инференса моделей

Длина очереди

Инфраструктура вызовов

Ошибки приложения

Сетевая архитектура

## Внешнее подключение не требуется

Все сервисы Mihu работают на серверах внутри собственной сети заказчика. Для промышленной эксплуатации не требуется VPN, туннель или постоянное соединение с Mihu.

Внутренние ИИ-сервисы не нуждаются в публичном доступе. Телефония поступает в SIP-инфраструктуру через существующее подключение заказчика к оператору или АТС (PBX), а сетевые правила полностью определяются инфраструктурными политиками и политиками безопасности заказчика.

Сеть клиента

Точки входа SIP trunk / PBX Веб-приложение API

Core / Orchestration / SIP

STT LLM TTS Действия

БД / Кэш / Хранилище

Эксплуатация Логи Уведомления Мониторинг

Требования к инфраструктуре

## Базовая промышленная конфигурация

Для промышленной установки Mihu On-Premise исходная конфигурация инфраструктуры определяется исходя из ожидаемой параллельной нагрузки и объёмов работы.

### Вычислительные ресурсы

128 vCPU

Рекомендуемый минимум · базовые сервисы и речевой слой на CPU

+ GPU

В зависимости от выбранной модели · например, Kimi K2.6 Instant, Qwen, Llama или Mistral; рекомендуемая модель может меняться со временем

База в 128 vCPU покрывает сервисы Mihu Core и STT/TTS на CPU. Она не покрывает слой рассуждений: высокопроизводительная самостоятельно размещённая LLM, например Kimi K2.6 Instant, требует выделенной GPU-инфраструктуры в дополнение к этой базе, рассчитанной под выбранную модель и ожидаемую параллельность. Выбор более компактной модели с открытыми весами соответственно снижает потребность в GPU. GPU-мощности добавляются и в случае, когда требуются многоязычные речевые модели на GPU. Точное распределение зависит от числа одновременных ИИ-разговоров, нагрузки STT/TTS, развёрнутых языков, выбора LLM, конфигурации резервирования и дополнительных сервисов, таких как Builder и MCP.

Распределение физических ядер и vCPU подтверждается в предложении по развёртыванию.

### Хранилище

вызовы × средняя длительность × формат записи × срок хранения

Ёмкость для записей

Требования к хранилищу в первую очередь зависят от того, хранятся ли записи разговоров и другие медиафайлы локально. Базы данных приложения Mihu требуют постоянного хранилища, тогда как ёмкость для записей рассчитывается отдельно. Клиентам, хранящим записи месяцами или годами, следует выделить отдельный том хранилища, объём которого соответствует их политике хранения.

Клиенты сами определяют свои

хранение записей

хранение расшифровок

политика резервного копирования

политика архивирования

политика удаления

### Высокая доступность

99.9%

Целевой уровень эксплуатационной доступности

Промышленная архитектура может быть настроена с резервированием критически важных сервисов Mihu. Достижение этого целевого показателя требует поддержания согласованной промышленной архитектуры, резервирования и инфраструктурных требований.

Для корпоративных установок on-premise назначается выделенная эксплуатационная ответственность. При отсутствии сбоев базовой инфраструктуры или оборудования, находящихся вне зоны эксплуатационной ответственности Mihu, развёртывание проектируется с ориентиром на согласованный целевой уровень доступности сервиса 99,9%. Ответственность по каждому слою определяется в документе SLA.

Развёртывание

## Предварительно настроено, в контейнерах Docker, внедряется совместно с вашей командой инфраструктуры

Полный стек Mihu предоставляется в виде предварительно настроенных сервисов Docker. Инженерная команда Mihu отвечает за конфигурацию развёртывания и готовность к промышленной эксплуатации совместно с командой инфраструктуры клиента. Типичное on-premise развёртывание занимает 3–6 месяцев — от подготовки инфраструктуры до промышленной эксплуатации — и доступно корпоративным заказчикам.

Подготовка инфраструктуры

Настройка сети

Сервисы Mihu

Речевые модели

LLM

Телефония

Хранилище

Наблюдаемость

Валидация

Промышленная эксплуатация

Kubernetes: стек можно развернуть с помощью Helm-чартов. Стандартный и самый быстрый путь Mihu — развёртывание Kubernetes под управлением Rancher.

### Версионирование и релизы

Mihu On-Premise использует версионирование на основе веток: каждое развёртывание заказчика работает в собственной релизной ветке, а обновления поставляются как ежемесячные релизы. Каждый релиз проверяется перед выкаткой и применяется по согласованию с инфраструктурной командой заказчика, поэтому обновления планируются, а не навязываются. Валидация релиза охватывает стандартный набор тестов; отдельные модульные тесты могут отличаться в зависимости от индивидуальных доработок для заказчика.

### Выделенная команда поддержки

Для каждой on-premise среды Mihu выделяет команду customer success и команду DevOps, которые работают вместе с вашей командой. Поддержка ведётся в общей группе Slack, поэтому операционные вопросы, согласование релизов и инциденты решаются напрямую с людьми, которые знают ваше развёртывание.

## Всё остаётся внутри.

Обзор на одной странице: что и где работает при развёртывании Mihu On-Premise.

Речь On-premise

Mihu STT CPU

Mihu TTS CPU

Клонирование голоса Приватное

LLM Открытые веса / self-hosted

Fine-tuning На инфраструктуре клиента

Телефония SIP

Данные Под контролем клиента

Записи Под контролем клиента

База данных On-premise

Интеграции Action Server on-premise

Развёртывание В контейнерах Docker · Kubernetes (Rancher / Helm)

Подключение Внутри сети заказчика

Наблюдаемость Выделенная

Целевой показатель SLA 99.9%

Поставка 3–6 месяцев до промышленной эксплуатации

Доступность Корпоративные заказчики

Поддержка Команда customer success + DevOps, общая группа Slack

Релизы Ежемесячные, версионирование по веткам

Частые вопросы

## Mihu AI On-Premise — часто задаваемые вопросы

Что именно работает внутри нашей инфраструктуры?

Полный стек: Speech-to-Text, Text-to-Speech, клонирование голоса, LLM-слой рассуждений, оркестрация, SIP-телефония, Action Server для интеграций, приложение управления, а также слои базы данных и Redis. Данные клиентов не обязаны покидать вашу среду.

Нужны ли нам GPU?

Для речевого слоя — нет. STT и TTS работают на CPU с моделями примерно от 66M до 143M параметров. Высокопроизводительные LLM с открытыми весами, как правило, требуют GPU-инфраструктуры; мощность GPU также добавляется, если Вы выбираете более крупные многоязычные речевые модели.

Какие языки поддерживает речевой стек on-premise?

Текущий on-premise речевой стек на CPU поддерживает семь языков: английский, немецкий, французский, испанский, итальянский, русский и турецкий. Эти языковые модели Mihu STT и Mihu TTS работают на CPU, без GPU. Mihu STT обычно достигает около 5–9% пословной ошибки (WER); точное значение зависит от языка и набора данных для оценки.

Какая LLM используется и можно ли заменить её позднее?

Слой рассуждений не зависит от конкретной модели и работает на моделях с открытыми весами. Mihu рекомендует модель на дату развёртывания, а там, где нужно выполнить требования к закупкам или к происхождению модели, могут быть выбраны альтернативы от разных поставщиков и из разных регионов, например Llama или Mistral наряду с Kimi K2.6 Instant. Модель можно обновить или заменить независимо от остальной инфраструктуры агентов по мере появления более совершенных моделей с открытыми весами.

Можем ли мы выполнить fine-tuning речевых моделей на собственных данных?

Да. Поддерживаемые модели STT и TTS могут быть дообучены на инфраструктуре, контролируемой клиентом, с использованием ваших собственных наборов данных, поэтому проприетарное аудио никогда не передаётся стороннему поставщику. Полученные модели остаются приватными для вашей организации.

Какая инфраструктура нужна для старта?

Типичная производственная база начинается со 128 vCPU для базовых сервисов Mihu и речевого слоя на CPU. Самостоятельно размещённая LLM рассчитывается отдельно и требует выделенной GPU-инфраструктуры в дополнение к этой базе; GPU-мощности добавляются и для многоязычных речевых моделей на GPU. Хранилище рассчитывается исходя из вашей политики хранения записей и транскриптов. Точный расчёт подтверждается в предложении по развёртыванию.

Как поставляется и подключается развёртывание?

Всё поставляется в виде преднастроенных Docker-сервисов и работает на собственных серверах заказчика. Для промышленной эксплуатации не требуется VPN или обратное соединение с Mihu, и ни один внутренний ИИ-сервис не нуждается в публичном доступе. Инженерная команда Mihu выполняет настройку развёртывания совместно с вашей инфраструктурной командой.

Можете ли вы обучить STT и TTS для языка, не входящего в текущие семь?

Да. Новые языки добавляются по запросу. Трудоёмкость обучения зависит от языковой группы; STT и TTS обучаются отдельно. Mihu может предоставить или приобрести обучающий набор данных для вас либо работать с данными, которые предоставите вы. Обучение выполняется на предоставленных вами машинах или на инфраструктуре Mihu, после чего полученные модели Mihu STT и Mihu TTS развёртываются в вашей среде точно так же, как стандартные.

## Планируете развёртывание on-premise?

Сообщите ожидаемую параллельную нагрузку, языки и требования к резидентности данных. Наша инженерная команда вернётся к Вам с предложением по расчёту мощностей и планом развёртывания.

Связаться с отделом продаж (https://mihu.ai/ru/contact)
