Mihu AI On-Premise

Ваши агенты. Ваши модели. Ваши голоса. Ваша инфраструктура. Ваши данные.

Mihu разворачивает полный стек ИИ-агентов — от распознавания речи и рассуждений до телефонии и действий — внутри вашей инфраструктуры. Данные клиентов не обязаны покидать вашу среду.

7
Языков речи on-premise
CPU
Инференс Mihu STT и TTS
99.9%
Целевой уровень доступности
Границы развёртывания
Внутри вашей сети
Телефония
SIP-инфраструктура, сервисы массовых рассылок
Локально
Речь
Mihu STT, Mihu TTS и клонирование голоса на CPU
Локально
Рассуждения
LLM с открытыми весами, self-hosted
Локально
Действия
Action Server, интеграции, рабочие процессы
Локально
Данные
База данных, Redis, записи, расшифровки
Локально
Обзор

Приватная голосовая ИИ-инфраструктура, полностью развёрнутая в вашей среде.

Mihu AI On-Premise — это корпоративное предложение, которое позволяет организациям запускать полный стек ИИ-агентов Mihu в собственной инфраструктуре.

Обработка речи, ИИ-инференс, оркестрация, телефония, интеграции, прикладные сервисы и хранение данных могут работать так, что данные клиентов не покидают среду организации.

Всё развёртывание поставляется в виде контейнеризированных Docker-сервисов и работает на инфраструктуре, управляемой заказчиком, в Kubernetes с помощью Rancher или Helm.

Речь
On-premise, инференс на CPU
LLM
Открытые веса, self-hosted
Телефония
SIP внутри вашей сети
Данные
Хранение под контролем клиента
Речевая инфраструктура

Mihu STT и Mihu TTS — полностью on-premise.

Mihu предоставляет собственные речевые модели — Mihu STT (Speech-to-Text) и Mihu TTS (Text-to-Speech) — полностью on-premise. Для поддерживаемых развёртываний:

  • Mihu STT (Speech-to-Text) работает локально.
  • Mihu TTS (Text-to-Speech) работает локально.
  • Для речевого слоя поддерживается инференс исключительно на CPU.
  • Внешний речевой API не требуется.
  • Клонирование голоса может быть развёрнуто внутри инфраструктуры клиента.
  • Аудиоданные и обучающие данные клиента могут полностью оставаться в среде клиента.
Текущий речевой стек on-premise · 7 языков
Английский Немецкий Французский Испанский Итальянский Русский Турецкий

Эти 7 языков полностью работают на собственных STT- и TTS-моделях Mihu внутри вашей инфраструктуры. Облачная платформа Mihu поддерживает более 40 языков за счёт дополнительных речевых моделей.

5–9%
Типичная доля ошибочных слов (WER) в текущих развёртываниях Mihu STT (Speech-to-Text) — в зависимости от языка и оценочного набора данных.

Лёгкие речевые модели для CPU

Речевая инфраструктура Mihu спроектирована так, чтобы требования к инференсу оставались небольшими. В зависимости от языка и конфигурации модели развёртываемые речевые модели содержат примерно 66M – 143M параметров.

Это позволяет выполнять задачи STT и TTS на CPU-инфраструктуре, не требуя выделенного GPU для каждой голосовой нагрузки.

Фактическая ёмкость зависит от
  • одновременных разговоров
  • выбранного языка
  • выбранной модели STT/TTS
  • конфигурации аудио
  • целевой задержки
  • требований к резервированию

Показатели параллельной нагрузки определяются для каждого развёртывания посредством тестирования на целевом оборудовании и не указываются как фиксированное соотношение CPU к числу вызовов.

Кастомизация

Приватный fine-tuning и клонирование голоса

Собственные речевые данные и брендовые голоса остаются на инфраструктуре, которую контролируете Вы.

Приватный fine-tuning

Организации, располагающие качественными собственными речевыми данными, могут дополнительно адаптировать речевой слой. Mihu может выполнить fine-tuning поддерживаемых моделей STT/TTS непосредственно на инфраструктуре, контролируемой клиентом, чтобы проприетарные наборы данных не передавались стороннему поставщику инференса.

Пользовательские модели могут быть
  • дообучены на наборах данных, предоставленных клиентом
  • оптимизированы под отраслевую терминологию
  • адаптированы под акценты и предметно-специфичную речь
  • развёрнуты исключительно внутри инфраструктуры клиента
  • остаются приватными, полностью в вашей собственной инфраструктуре

Особенно полезно для организаций со специализированной лексикой, региональными акцентами или строгими требованиями к резидентности данных.

Клонирование голоса

Mihu On-Premise также поддерживает приватное клонирование голоса. Предоставленные образцы голоса могут использоваться для создания голосов, специфичных для организации, которые затем размещаются в собственной инфраструктуре клиента.

Как исходные записи, так и полученная голосовая модель могут оставаться приватными.

Это позволяет предприятиям создавать единообразные брендовые голоса, не полагаясь на внешнего поставщика TTS во время промышленного инференса.

Требование к образцу голоса: около 30 секунд чистой речи, записанной без длинных пауз и промежутков между предложениями.

Многоязычная архитектура

Языковые модели на CPU или многоязычные на GPU

Лёгкие речевые модели для CPU в основном специфичны для отдельного языка, а не представляют собой единую многоязычную модель. Для ИИ-агентов, которым необходимо динамически переключать языки в рамках одного взаимодействия, Mihu поддерживает несколько стратегий развёртывания.

Эффективность CPU

Оркестрация моделей

Несколько языковых речевых моделей работают одновременно. Слой оркестрации Mihu определяет или получает активный язык и динамически направляет обработку речи в соответствующую модель.

Выбором модели можно также управлять с помощью системных переопределений во время взаимодействия.

Максимальная многоязычная гибкость

Многоязычные модели на GPU

Для сценариев, требующих высокодинамичных многоязычных разговоров, вместо этого могут быть развёрнуты более крупные многоязычные речевые модели на GPU-инфраструктуре.

Архитектура оптимизируется либо под эффективность CPU с языковыми моделями, либо под максимальную многоязычную гибкость с моделями на GPU — в зависимости от характера нагрузки.

Примечание: многоязычные STT и TTS требуют GPU-инфраструктуры. Режим только на CPU относится к языковым моделям Mihu STT и Mihu TTS.

Локальная LLM-инфраструктура

Слой рассуждений работает на моделях с открытыми весами внутри вашей среды.

Слой рассуждений работает полностью в вашей среде на LLM с открытыми весами: это модели, веса которых опубликованы публично и которые могут работать полностью офлайн на вашем собственном оборудовании, без какого-либо соединения с поставщиком модели. Mihu постоянно оценивает новые модели с открытыми весами, вместо того чтобы навсегда привязывать on-premise стек к одному семейству моделей.

Высокопроизводительные развёртывания LLM, как правило, требуют GPU-инфраструктуры. Рекомендуемая модель может меняться по мере появления новых моделей, и Mihu может обновить или заменить модель рассуждений независимо от остальной инфраструктуры агентов.

Инфраструктура не зависит от конкретной модели. Лучшая доступная модель может меняться; вашей архитектуре меняться не обязательно.

Рекомендуемая конфигурация на дату развёртывания

Модель рассуждений выбирается на момент развёртывания из текущего набора для оценки. По состоянию на сентябрь 2026 года одна из наших предпочтительных высокопроизводительных конфигураций — Kimi K2.6 Instant. Она работает на выделенной GPU-инфраструктуре, выделяемой в дополнение к базе в 128 vCPU. Там, где действуют требования к закупкам или к происхождению модели, могут быть выбраны альтернативы с открытыми весами от других поставщиков и из других регионов, например Llama или Mistral. Выбор подтверждается в каждом предложении по развёртыванию.

Инфраструктура Mihu Core

Из чего состоит полное развёртывание

Полное развёртывание Mihu On-Premise состоит из нескольких независимых сервисов. Все базовые компоненты поставляются в виде контейнеризированных Docker-сервисов и развёртываются в Kubernetes с помощью Rancher или Helm.

01

Mihu Core

Основная среда выполнения ИИ-агентов и бизнес-логика.

02

Mihu Orchestration

Координирует речевые модели, LLM, агентов и сервисы среды выполнения.

03

Mihu Relay

Слой обмена данными в реальном времени между сервисами и сессиями агентов.

04

SIP-инфраструктура

Обеспечивает корпоративную телефонию и SIP-подключение.

05

Сервисы массовых рассылок

Поддерживает исходящие коммуникации и нагрузки большого объёма.

06

Action Server

Выполняет инструменты, интеграции и действия агентов.

07

Управление / веб-приложение

Интерфейс администрирования, настройки и оперативного управления.

08

Инфраструктура баз данных

Постоянное хранение прикладных и операционных данных.

09

Инфраструктура Redis

Состояние в реальном времени, кеширование и распределённая координация среды выполнения.

Дополнительная инфраструктура

Дополнительные возможности Mihu также могут быть развёрнуты on-premise. Эти компоненты требуют дополнительной серверной мощности в зависимости от объёма использования.

Mihu Builder

Для генерации и запуска собственных сервисов, кода, интеграций и рабочих процессов. Для работы Builder требуются дополнительные GPU-мощности на сервере.

Mihu MCP Server

Для предоставления рабочего пространства и возможностей Mihu ИИ-системам, совместимым с MCP.

PBX Connector Server

Подключает вашу существующую АТС (PBX) или телефонную систему к SIP-инфраструктуре Mihu для входящих и исходящих звонков.

SMTP-сервер

Требуется, если вы хотите подключить email-канал. Письма агентов и уведомления отправляются через ваш собственный SMTP-сервер.

Наблюдаемость и логирование

Выделенная наблюдаемость для промышленных развёртываний

Промышленные развёртывания должны включать выделенную инфраструктуру наблюдаемости. Mihu рекомендует отдельную инфраструктуру для централизованного логирования и мониторинга.

Централизованное логирование

Логи Mihu Core, оркестрации, SIP, relay, серверов моделей и прикладных сервисов собираются централизованно.

Мониторинг

Инфраструктурные и прикладные метрики отслеживаются непрерывно. При превышении заранее заданных эксплуатационных порогов могут формироваться оповещения.

Отслеживаемые метрики
  • Загрузка CPU
  • Использование памяти
  • Загрузка GPU
  • Объём дискового пространства
  • Состояние сети
  • Состояние сервисов
  • Задержка инференса моделей
  • Длина очереди
  • Инфраструктура вызовов
  • Ошибки приложения
Сетевая архитектура

Внешнее подключение не требуется

Все сервисы Mihu работают на серверах внутри собственной сети заказчика. Для промышленной эксплуатации не требуется VPN, туннель или постоянное соединение с Mihu.

Внутренние ИИ-сервисы не нуждаются в публичном доступе. Телефония поступает в SIP-инфраструктуру через существующее подключение заказчика к оператору или АТС (PBX), а сетевые правила полностью определяются инфраструктурными политиками и политиками безопасности заказчика.

Сеть клиента
Точки входаSIP trunk / PBXВеб-приложениеAPI
Core / Orchestration / SIP
STTLLMTTSДействия
БД / Кэш / Хранилище
ЭксплуатацияЛогиУведомленияМониторинг
Требования к инфраструктуре

Базовая промышленная конфигурация

Для промышленной установки Mihu On-Premise исходная конфигурация инфраструктуры определяется исходя из ожидаемой параллельной нагрузки и объёмов работы.

Вычислительные ресурсы

128 vCPU
Рекомендуемый минимум · базовые сервисы и речевой слой на CPU
+ GPU
В зависимости от выбранной модели · например, Kimi K2.6 Instant, Qwen, Llama или Mistral; рекомендуемая модель может меняться со временем

База в 128 vCPU покрывает сервисы Mihu Core и STT/TTS на CPU. Она не покрывает слой рассуждений: высокопроизводительная самостоятельно размещённая LLM, например Kimi K2.6 Instant, требует выделенной GPU-инфраструктуры в дополнение к этой базе, рассчитанной под выбранную модель и ожидаемую параллельность. Выбор более компактной модели с открытыми весами соответственно снижает потребность в GPU. GPU-мощности добавляются и в случае, когда требуются многоязычные речевые модели на GPU. Точное распределение зависит от числа одновременных ИИ-разговоров, нагрузки STT/TTS, развёрнутых языков, выбора LLM, конфигурации резервирования и дополнительных сервисов, таких как Builder и MCP.

Распределение физических ядер и vCPU подтверждается в предложении по развёртыванию.

Хранилище

вызовы × средняя длительность × формат записи × срок хранения
Ёмкость для записей

Требования к хранилищу в первую очередь зависят от того, хранятся ли записи разговоров и другие медиафайлы локально. Базы данных приложения Mihu требуют постоянного хранилища, тогда как ёмкость для записей рассчитывается отдельно. Клиентам, хранящим записи месяцами или годами, следует выделить отдельный том хранилища, объём которого соответствует их политике хранения.

Клиенты сами определяют свои
  • хранение записей
  • хранение расшифровок
  • политика резервного копирования
  • политика архивирования
  • политика удаления

Высокая доступность

99.9%
Целевой уровень эксплуатационной доступности

Промышленная архитектура может быть настроена с резервированием критически важных сервисов Mihu. Достижение этого целевого показателя требует поддержания согласованной промышленной архитектуры, резервирования и инфраструктурных требований.

Для корпоративных установок on-premise назначается выделенная эксплуатационная ответственность. При отсутствии сбоев базовой инфраструктуры или оборудования, находящихся вне зоны эксплуатационной ответственности Mihu, развёртывание проектируется с ориентиром на согласованный целевой уровень доступности сервиса 99,9%. Ответственность по каждому слою определяется в документе SLA.

Развёртывание

Предварительно настроено, в контейнерах Docker, внедряется совместно с вашей командой инфраструктуры

Полный стек Mihu предоставляется в виде предварительно настроенных сервисов Docker. Инженерная команда Mihu отвечает за конфигурацию развёртывания и готовность к промышленной эксплуатации совместно с командой инфраструктуры клиента. Типичное on-premise развёртывание занимает 3–6 месяцев — от подготовки инфраструктуры до промышленной эксплуатации — и доступно корпоративным заказчикам.

  1. Подготовка инфраструктуры
  2. Настройка сети
  3. Сервисы Mihu
  4. Речевые модели
  5. LLM
  6. Телефония
  7. Хранилище
  8. Наблюдаемость
  9. Валидация
  10. Промышленная эксплуатация

Kubernetes: стек можно развернуть с помощью Helm-чартов. Стандартный и самый быстрый путь Mihu — развёртывание Kubernetes под управлением Rancher.

Версионирование и релизы

Mihu On-Premise использует версионирование на основе веток: каждое развёртывание заказчика работает в собственной релизной ветке, а обновления поставляются как ежемесячные релизы. Каждый релиз проверяется перед выкаткой и применяется по согласованию с инфраструктурной командой заказчика, поэтому обновления планируются, а не навязываются. Валидация релиза охватывает стандартный набор тестов; отдельные модульные тесты могут отличаться в зависимости от индивидуальных доработок для заказчика.

Выделенная команда поддержки

Для каждой on-premise среды Mihu выделяет команду customer success и команду DevOps, которые работают вместе с вашей командой. Поддержка ведётся в общей группе Slack, поэтому операционные вопросы, согласование релизов и инциденты решаются напрямую с людьми, которые знают ваше развёртывание.

Всё остаётся внутри.

Обзор на одной странице: что и где работает при развёртывании Mihu On-Premise.

РечьOn-premise
Mihu STTCPU
Mihu TTSCPU
Клонирование голосаПриватное
LLMОткрытые веса / self-hosted
Fine-tuningНа инфраструктуре клиента
ТелефонияSIP
ДанныеПод контролем клиента
ЗаписиПод контролем клиента
База данныхOn-premise
ИнтеграцииAction Server on-premise
РазвёртываниеВ контейнерах Docker · Kubernetes (Rancher / Helm)
ПодключениеВнутри сети заказчика
НаблюдаемостьВыделенная
Целевой показатель SLA99.9%
Поставка3–6 месяцев до промышленной эксплуатации
ДоступностьКорпоративные заказчики
ПоддержкаКоманда customer success + DevOps, общая группа Slack
РелизыЕжемесячные, версионирование по веткам
Частые вопросы

Mihu AI On-Premise — часто задаваемые вопросы

Что именно работает внутри нашей инфраструктуры?

Полный стек: Speech-to-Text, Text-to-Speech, клонирование голоса, LLM-слой рассуждений, оркестрация, SIP-телефония, Action Server для интеграций, приложение управления, а также слои базы данных и Redis. Данные клиентов не обязаны покидать вашу среду.

Нужны ли нам GPU?

Для речевого слоя — нет. STT и TTS работают на CPU с моделями примерно от 66M до 143M параметров. Высокопроизводительные LLM с открытыми весами, как правило, требуют GPU-инфраструктуры; мощность GPU также добавляется, если Вы выбираете более крупные многоязычные речевые модели.

Какие языки поддерживает речевой стек on-premise?

Текущий on-premise речевой стек на CPU поддерживает семь языков: английский, немецкий, французский, испанский, итальянский, русский и турецкий. Эти языковые модели Mihu STT и Mihu TTS работают на CPU, без GPU. Mihu STT обычно достигает около 5–9% пословной ошибки (WER); точное значение зависит от языка и набора данных для оценки.

Какая LLM используется и можно ли заменить её позднее?

Слой рассуждений не зависит от конкретной модели и работает на моделях с открытыми весами. Mihu рекомендует модель на дату развёртывания, а там, где нужно выполнить требования к закупкам или к происхождению модели, могут быть выбраны альтернативы от разных поставщиков и из разных регионов, например Llama или Mistral наряду с Kimi K2.6 Instant. Модель можно обновить или заменить независимо от остальной инфраструктуры агентов по мере появления более совершенных моделей с открытыми весами.

Можем ли мы выполнить fine-tuning речевых моделей на собственных данных?

Да. Поддерживаемые модели STT и TTS могут быть дообучены на инфраструктуре, контролируемой клиентом, с использованием ваших собственных наборов данных, поэтому проприетарное аудио никогда не передаётся стороннему поставщику. Полученные модели остаются приватными для вашей организации.

Какая инфраструктура нужна для старта?

Типичная производственная база начинается со 128 vCPU для базовых сервисов Mihu и речевого слоя на CPU. Самостоятельно размещённая LLM рассчитывается отдельно и требует выделенной GPU-инфраструктуры в дополнение к этой базе; GPU-мощности добавляются и для многоязычных речевых моделей на GPU. Хранилище рассчитывается исходя из вашей политики хранения записей и транскриптов. Точный расчёт подтверждается в предложении по развёртыванию.

Как поставляется и подключается развёртывание?

Всё поставляется в виде преднастроенных Docker-сервисов и работает на собственных серверах заказчика. Для промышленной эксплуатации не требуется VPN или обратное соединение с Mihu, и ни один внутренний ИИ-сервис не нуждается в публичном доступе. Инженерная команда Mihu выполняет настройку развёртывания совместно с вашей инфраструктурной командой.

Можете ли вы обучить STT и TTS для языка, не входящего в текущие семь?

Да. Новые языки добавляются по запросу. Трудоёмкость обучения зависит от языковой группы; STT и TTS обучаются отдельно. Mihu может предоставить или приобрести обучающий набор данных для вас либо работать с данными, которые предоставите вы. Обучение выполняется на предоставленных вами машинах или на инфраструктуре Mihu, после чего полученные модели Mihu STT и Mihu TTS развёртываются в вашей среде точно так же, как стандартные.

Планируете развёртывание on-premise?

Сообщите ожидаемую параллельную нагрузку, языки и требования к резидентности данных. Наша инженерная команда вернётся к Вам с предложением по расчёту мощностей и планом развёртывания.