Mihu разворачивает полный стек ИИ-агентов — от распознавания речи и рассуждений до телефонии и действий — внутри вашей инфраструктуры. Данные клиентов не обязаны покидать вашу среду.
Mihu AI On-Premise — это корпоративное предложение, которое позволяет организациям запускать полный стек ИИ-агентов Mihu в собственной инфраструктуре.
Обработка речи, ИИ-инференс, оркестрация, телефония, интеграции, прикладные сервисы и хранение данных могут работать так, что данные клиентов не покидают среду организации.
Всё развёртывание поставляется в виде контейнеризированных Docker-сервисов и работает на инфраструктуре, управляемой заказчиком, в Kubernetes с помощью Rancher или Helm.
Mihu предоставляет собственные речевые модели — Mihu STT (Speech-to-Text) и Mihu TTS (Text-to-Speech) — полностью on-premise. Для поддерживаемых развёртываний:
Эти 7 языков полностью работают на собственных STT- и TTS-моделях Mihu внутри вашей инфраструктуры. Облачная платформа Mihu поддерживает более 40 языков за счёт дополнительных речевых моделей.
Речевая инфраструктура Mihu спроектирована так, чтобы требования к инференсу оставались небольшими. В зависимости от языка и конфигурации модели развёртываемые речевые модели содержат примерно 66M – 143M параметров.
Это позволяет выполнять задачи STT и TTS на CPU-инфраструктуре, не требуя выделенного GPU для каждой голосовой нагрузки.
Показатели параллельной нагрузки определяются для каждого развёртывания посредством тестирования на целевом оборудовании и не указываются как фиксированное соотношение CPU к числу вызовов.
Собственные речевые данные и брендовые голоса остаются на инфраструктуре, которую контролируете Вы.
Организации, располагающие качественными собственными речевыми данными, могут дополнительно адаптировать речевой слой. Mihu может выполнить fine-tuning поддерживаемых моделей STT/TTS непосредственно на инфраструктуре, контролируемой клиентом, чтобы проприетарные наборы данных не передавались стороннему поставщику инференса.
Особенно полезно для организаций со специализированной лексикой, региональными акцентами или строгими требованиями к резидентности данных.
Mihu On-Premise также поддерживает приватное клонирование голоса. Предоставленные образцы голоса могут использоваться для создания голосов, специфичных для организации, которые затем размещаются в собственной инфраструктуре клиента.
Как исходные записи, так и полученная голосовая модель могут оставаться приватными.
Это позволяет предприятиям создавать единообразные брендовые голоса, не полагаясь на внешнего поставщика TTS во время промышленного инференса.
Требование к образцу голоса: около 30 секунд чистой речи, записанной без длинных пауз и промежутков между предложениями.
Лёгкие речевые модели для CPU в основном специфичны для отдельного языка, а не представляют собой единую многоязычную модель. Для ИИ-агентов, которым необходимо динамически переключать языки в рамках одного взаимодействия, Mihu поддерживает несколько стратегий развёртывания.
Несколько языковых речевых моделей работают одновременно. Слой оркестрации Mihu определяет или получает активный язык и динамически направляет обработку речи в соответствующую модель.
Выбором модели можно также управлять с помощью системных переопределений во время взаимодействия.
Для сценариев, требующих высокодинамичных многоязычных разговоров, вместо этого могут быть развёрнуты более крупные многоязычные речевые модели на GPU-инфраструктуре.
Архитектура оптимизируется либо под эффективность CPU с языковыми моделями, либо под максимальную многоязычную гибкость с моделями на GPU — в зависимости от характера нагрузки.
Примечание: многоязычные STT и TTS требуют GPU-инфраструктуры. Режим только на CPU относится к языковым моделям Mihu STT и Mihu TTS.
Слой рассуждений работает полностью в вашей среде на LLM с открытыми весами: это модели, веса которых опубликованы публично и которые могут работать полностью офлайн на вашем собственном оборудовании, без какого-либо соединения с поставщиком модели. Mihu постоянно оценивает новые модели с открытыми весами, вместо того чтобы навсегда привязывать on-premise стек к одному семейству моделей.
Высокопроизводительные развёртывания LLM, как правило, требуют GPU-инфраструктуры. Рекомендуемая модель может меняться по мере появления новых моделей, и Mihu может обновить или заменить модель рассуждений независимо от остальной инфраструктуры агентов.
Инфраструктура не зависит от конкретной модели. Лучшая доступная модель может меняться; вашей архитектуре меняться не обязательно.
Модель рассуждений выбирается на момент развёртывания из текущего набора для оценки. По состоянию на сентябрь 2026 года одна из наших предпочтительных высокопроизводительных конфигураций — Kimi K2.6 Instant. Она работает на выделенной GPU-инфраструктуре, выделяемой в дополнение к базе в 128 vCPU. Там, где действуют требования к закупкам или к происхождению модели, могут быть выбраны альтернативы с открытыми весами от других поставщиков и из других регионов, например Llama или Mistral. Выбор подтверждается в каждом предложении по развёртыванию.
Полное развёртывание Mihu On-Premise состоит из нескольких независимых сервисов. Все базовые компоненты поставляются в виде контейнеризированных Docker-сервисов и развёртываются в Kubernetes с помощью Rancher или Helm.
Основная среда выполнения ИИ-агентов и бизнес-логика.
Координирует речевые модели, LLM, агентов и сервисы среды выполнения.
Слой обмена данными в реальном времени между сервисами и сессиями агентов.
Обеспечивает корпоративную телефонию и SIP-подключение.
Поддерживает исходящие коммуникации и нагрузки большого объёма.
Выполняет инструменты, интеграции и действия агентов.
Интерфейс администрирования, настройки и оперативного управления.
Постоянное хранение прикладных и операционных данных.
Состояние в реальном времени, кеширование и распределённая координация среды выполнения.
Дополнительные возможности Mihu также могут быть развёрнуты on-premise. Эти компоненты требуют дополнительной серверной мощности в зависимости от объёма использования.
Для генерации и запуска собственных сервисов, кода, интеграций и рабочих процессов. Для работы Builder требуются дополнительные GPU-мощности на сервере.
Для предоставления рабочего пространства и возможностей Mihu ИИ-системам, совместимым с MCP.
Подключает вашу существующую АТС (PBX) или телефонную систему к SIP-инфраструктуре Mihu для входящих и исходящих звонков.
Требуется, если вы хотите подключить email-канал. Письма агентов и уведомления отправляются через ваш собственный SMTP-сервер.
Промышленные развёртывания должны включать выделенную инфраструктуру наблюдаемости. Mihu рекомендует отдельную инфраструктуру для централизованного логирования и мониторинга.
Логи Mihu Core, оркестрации, SIP, relay, серверов моделей и прикладных сервисов собираются централизованно.
Инфраструктурные и прикладные метрики отслеживаются непрерывно. При превышении заранее заданных эксплуатационных порогов могут формироваться оповещения.
Все сервисы Mihu работают на серверах внутри собственной сети заказчика. Для промышленной эксплуатации не требуется VPN, туннель или постоянное соединение с Mihu.
Внутренние ИИ-сервисы не нуждаются в публичном доступе. Телефония поступает в SIP-инфраструктуру через существующее подключение заказчика к оператору или АТС (PBX), а сетевые правила полностью определяются инфраструктурными политиками и политиками безопасности заказчика.
Для промышленной установки Mihu On-Premise исходная конфигурация инфраструктуры определяется исходя из ожидаемой параллельной нагрузки и объёмов работы.
База в 128 vCPU покрывает сервисы Mihu Core и STT/TTS на CPU. Она не покрывает слой рассуждений: высокопроизводительная самостоятельно размещённая LLM, например Kimi K2.6 Instant, требует выделенной GPU-инфраструктуры в дополнение к этой базе, рассчитанной под выбранную модель и ожидаемую параллельность. Выбор более компактной модели с открытыми весами соответственно снижает потребность в GPU. GPU-мощности добавляются и в случае, когда требуются многоязычные речевые модели на GPU. Точное распределение зависит от числа одновременных ИИ-разговоров, нагрузки STT/TTS, развёрнутых языков, выбора LLM, конфигурации резервирования и дополнительных сервисов, таких как Builder и MCP.
Распределение физических ядер и vCPU подтверждается в предложении по развёртыванию.
Требования к хранилищу в первую очередь зависят от того, хранятся ли записи разговоров и другие медиафайлы локально. Базы данных приложения Mihu требуют постоянного хранилища, тогда как ёмкость для записей рассчитывается отдельно. Клиентам, хранящим записи месяцами или годами, следует выделить отдельный том хранилища, объём которого соответствует их политике хранения.
Промышленная архитектура может быть настроена с резервированием критически важных сервисов Mihu. Достижение этого целевого показателя требует поддержания согласованной промышленной архитектуры, резервирования и инфраструктурных требований.
Для корпоративных установок on-premise назначается выделенная эксплуатационная ответственность. При отсутствии сбоев базовой инфраструктуры или оборудования, находящихся вне зоны эксплуатационной ответственности Mihu, развёртывание проектируется с ориентиром на согласованный целевой уровень доступности сервиса 99,9%. Ответственность по каждому слою определяется в документе SLA.
Полный стек Mihu предоставляется в виде предварительно настроенных сервисов Docker. Инженерная команда Mihu отвечает за конфигурацию развёртывания и готовность к промышленной эксплуатации совместно с командой инфраструктуры клиента. Типичное on-premise развёртывание занимает 3–6 месяцев — от подготовки инфраструктуры до промышленной эксплуатации — и доступно корпоративным заказчикам.
Kubernetes: стек можно развернуть с помощью Helm-чартов. Стандартный и самый быстрый путь Mihu — развёртывание Kubernetes под управлением Rancher.
Mihu On-Premise использует версионирование на основе веток: каждое развёртывание заказчика работает в собственной релизной ветке, а обновления поставляются как ежемесячные релизы. Каждый релиз проверяется перед выкаткой и применяется по согласованию с инфраструктурной командой заказчика, поэтому обновления планируются, а не навязываются. Валидация релиза охватывает стандартный набор тестов; отдельные модульные тесты могут отличаться в зависимости от индивидуальных доработок для заказчика.
Для каждой on-premise среды Mihu выделяет команду customer success и команду DevOps, которые работают вместе с вашей командой. Поддержка ведётся в общей группе Slack, поэтому операционные вопросы, согласование релизов и инциденты решаются напрямую с людьми, которые знают ваше развёртывание.
Обзор на одной странице: что и где работает при развёртывании Mihu On-Premise.
Полный стек: Speech-to-Text, Text-to-Speech, клонирование голоса, LLM-слой рассуждений, оркестрация, SIP-телефония, Action Server для интеграций, приложение управления, а также слои базы данных и Redis. Данные клиентов не обязаны покидать вашу среду.
Для речевого слоя — нет. STT и TTS работают на CPU с моделями примерно от 66M до 143M параметров. Высокопроизводительные LLM с открытыми весами, как правило, требуют GPU-инфраструктуры; мощность GPU также добавляется, если Вы выбираете более крупные многоязычные речевые модели.
Текущий on-premise речевой стек на CPU поддерживает семь языков: английский, немецкий, французский, испанский, итальянский, русский и турецкий. Эти языковые модели Mihu STT и Mihu TTS работают на CPU, без GPU. Mihu STT обычно достигает около 5–9% пословной ошибки (WER); точное значение зависит от языка и набора данных для оценки.
Слой рассуждений не зависит от конкретной модели и работает на моделях с открытыми весами. Mihu рекомендует модель на дату развёртывания, а там, где нужно выполнить требования к закупкам или к происхождению модели, могут быть выбраны альтернативы от разных поставщиков и из разных регионов, например Llama или Mistral наряду с Kimi K2.6 Instant. Модель можно обновить или заменить независимо от остальной инфраструктуры агентов по мере появления более совершенных моделей с открытыми весами.
Да. Поддерживаемые модели STT и TTS могут быть дообучены на инфраструктуре, контролируемой клиентом, с использованием ваших собственных наборов данных, поэтому проприетарное аудио никогда не передаётся стороннему поставщику. Полученные модели остаются приватными для вашей организации.
Типичная производственная база начинается со 128 vCPU для базовых сервисов Mihu и речевого слоя на CPU. Самостоятельно размещённая LLM рассчитывается отдельно и требует выделенной GPU-инфраструктуры в дополнение к этой базе; GPU-мощности добавляются и для многоязычных речевых моделей на GPU. Хранилище рассчитывается исходя из вашей политики хранения записей и транскриптов. Точный расчёт подтверждается в предложении по развёртыванию.
Всё поставляется в виде преднастроенных Docker-сервисов и работает на собственных серверах заказчика. Для промышленной эксплуатации не требуется VPN или обратное соединение с Mihu, и ни один внутренний ИИ-сервис не нуждается в публичном доступе. Инженерная команда Mihu выполняет настройку развёртывания совместно с вашей инфраструктурной командой.
Да. Новые языки добавляются по запросу. Трудоёмкость обучения зависит от языковой группы; STT и TTS обучаются отдельно. Mihu может предоставить или приобрести обучающий набор данных для вас либо работать с данными, которые предоставите вы. Обучение выполняется на предоставленных вами машинах или на инфраструктуре Mihu, после чего полученные модели Mihu STT и Mihu TTS развёртываются в вашей среде точно так же, как стандартные.
Сообщите ожидаемую параллельную нагрузку, языки и требования к резидентности данных. Наша инженерная команда вернётся к Вам с предложением по расчёту мощностей и планом развёртывания.