# On-Premise внедряване — Mihu AI

Mihu AI On-Premise

# Вашите агенти. Вашите модели. Вашите гласове. Вашата инфраструктура. Вашите данни.

Mihu работи с целия стек от AI агенти — от реч и разсъждение до телефония и действия — във вашата инфраструктура. Клиентските данни не е необходимо да напускат вашата среда.

Свържете се с търговския екип (https://mihu.ai/bg/contact) Изисквания за внедряване (https://mihu.ai/bg/on-premise#requirements)

7

Езици за реч on-premise

CPU

Инференс на Mihu STT и TTS

99.9%

Целева наличност

Граница на внедряването

Във вашата мрежа

Телефония

SIP инфраструктура, услуги за масови комуникации

Локално

Реч

Mihu STT, Mihu TTS и клониране на глас на CPU

Локално

Разсъждение

LLM с отворени тегла, самостоятелно хостван

Локално

Действия

Action Server, интеграции, работни потоци

Локално

Данни

База данни, Redis, записи, транскрипции

Локално

Доставя се като контейнеризирани Docker услуги върху управлявана от клиента инфраструктура, внедрени в Kubernetes с Rancher или Helm.

Общ преглед

## Частна AI гласова инфраструктура, внедрена изцяло във вашата среда.

Mihu AI On-Premise е enterprise предложение, което позволява на организациите да работят с целия стек от AI агенти на Mihu в собствената си инфраструктура.

Обработката на реч, AI инференсът, оркестрацията, телефонията, интеграциите, приложните услуги и съхранението на данни могат да функционират, без клиентските данни да напускат средата на организацията.

Цялото внедряване се доставя като контейнеризирани Docker услуги и работи върху управлявана от клиента инфраструктура, внедрено в Kubernetes с Rancher или Helm.

Реч

On-premise, инференс на CPU

LLM

Отворени тегла, самостоятелно хостван

Телефония

SIP във вашата мрежа

Данни

Съхранение под контрола на клиента

Речева инфраструктура

## Mihu STT и Mihu TTS, изцяло on-premise.

Mihu предоставя собствените си гласови модели — Mihu STT (Speech-to-Text) и Mihu TTS (Text-to-Speech) — изцяло on-premise. За поддържаните внедрявания:

Mihu STT (Speech-to-Text) работи локално.

Mihu TTS (Text-to-Speech) работи локално.

За речевия слой се поддържа инференс само на CPU.

Не е необходим външен речеви API.

Клонирането на глас може да бъде внедрено в инфраструктурата на клиента.

Аудиото и обучителните данни на клиента могат да останат изцяло в средата на клиента.

Настоящ речеви стек on-premise · 7 езика

Английски Немски Френски Испански Италиански Руски Турски

Тези 7 езика работят изцяло върху собствените STT и TTS модели на Mihu, във вашата инфраструктура. Облачната платформа на Mihu поддържа над 40 езика чрез допълнителни гласови модели.

5–9%

Типична честота на грешките в думите (WER) при настоящите внедрявания на Mihu STT (Speech-to-Text), в зависимост от езика и набора от данни за оценка.

### Леки речеви модели за CPU

Речевата инфраструктура на Mihu е проектирана така, че изискванията към инференса да остават ниски. В зависимост от езика и конфигурацията на модела, внедрените речеви модели са с приблизително 66M – 143M параметъра.

Това позволява STT и TTS натоварванията да се изпълняват върху CPU инфраструктура, без да е необходим отделен GPU за всяко гласово натоварване.

Реалният капацитет зависи от

едновременни разговори

избрания език

избрания STT/TTS модел

аудио конфигурацията

целевата латентност

изискванията за резервираност

Стойностите за едновременност се определят за всяко внедряване чрез бенчмаркове върху целевия хардуер, а не се посочват като фиксирано съотношение между CPU и обаждания.

Персонализация

## Частен fine-tuning и клониране на глас

Собствените речеви данни и фирмените гласове остават върху инфраструктура, която Вие контролирате.

### Частен fine-tuning

Организации с висококачествени собствени речеви данни могат допълнително да персонализират речевия слой. Mihu може да извърши fine-tuning на поддържаните STT/TTS модели директно върху инфраструктура, контролирана от клиента, така че собствените набори от данни да не се прехвърлят към външен доставчик на инференс.

Персонализираните модели могат да бъдат

донастроени с набори от данни, предоставени от клиента

оптимизирани за специфична за отрасъла терминология

адаптирани към акценти и специфична за областта реч

внедрени изключително в инфраструктурата на клиента

поддържани частни, изцяло във вашата собствена инфраструктура

Особено полезно за организации със специализирана терминология, регионални акценти или строги изисквания за местоположение на данните.

### Клониране на глас

Mihu On-Premise поддържа и частно клониране на глас. Предоставените гласови проби могат да се използват за създаване на специфични за организацията гласове, които след това се хостват в собствената инфраструктура на клиента.

Както изходните записи, така и полученият гласов модел могат да останат частни.

Това позволява на предприятията да създават последователни фирмени гласове, без да разчитат на външен TTS доставчик по време на продукционния инференс.

Изискване за гласовата проба: около 30 секунди чиста реч, записана без дълги паузи или празнини между изреченията.

Многоезична архитектура

## Специфични за езика на CPU или многоезични на GPU

Леките речеви модели за CPU са предимно специфични за отделен език, а не един многоезичен модел. За AI агенти, които трябва да превключват езици динамично в рамките на едно и също взаимодействие, Mihu поддържа няколко стратегии за внедряване.

Ефективност на CPU

### Оркестрация на модели

Няколко специфични за езика речеви модела работят едновременно. Слоят за оркестрация на Mihu разпознава или получава активния език и динамично насочва обработката на реч към подходящия модел.

Изборът на модел може да се управлява и чрез системни настройки, приложени по време на взаимодействието.

Максимална многоезична гъвкавост

### Многоезични модели на GPU

За сценарии, изискващи силно динамични многоезични разговори, вместо това могат да бъдат внедрени по-големи многоезични речеви модели върху GPU инфраструктура.

Архитектурата се оптимизира или за ефективност на CPU със специфични за езика модели, или за максимална многоезична гъвкавост с модели, базирани на GPU, в зависимост от натоварването.

Забележка: многоезичният STT и многоезичният TTS изискват GPU инфраструктура. Пътят само на CPU се отнася за езиково специфичните модели Mihu STT и Mihu TTS.

Локална LLM инфраструктура

## Слоят за разсъждение работи с модели с отворени тегла във вашата среда.

Слоят за разсъждение работи изцяло във вашата среда с LLM с отворени тегла: модели, чиито тегла са публично достъпни и които могат да работят напълно офлайн на ваш собствен хардуер, без връзка с доставчика на модела. Mihu непрекъснато оценява нови модели с отворени тегла, вместо да обвързва трайно on-premise стека с едно семейство модели.

Високопроизводителните LLM внедрявания по правило изискват GPU инфраструктура. Препоръчваният модел може да се промени с появата на нови модели, а Mihu може да актуализира или замени модела за разсъждение независимо от останалата част от инфраструктурата на агентите.

Инфраструктурата не зависи от конкретен модел. Най-добрият наличен модел може да се промени; вашата архитектура не е необходимо да се променя.

Препоръчана конфигурация към датата на внедряване

Моделът за разсъждение се избира при внедряването от текущия набор за оценка. Към септември 2026 г. една от предпочитаните ни високопроизводителни конфигурации е Kimi K2.6 Instant. Той работи върху отделна GPU инфраструктура, осигурена в допълнение към базата от 128 vCPU. Когато има изисквания за доставка или за произхода на модела, могат да бъдат избрани алтернативи с отворени тегла от други доставчици и региони, като Llama или Mistral. Изборът се потвърждава във всяко предложение за внедряване.

Инфраструктура Mihu Core

## От какво се състои пълното внедряване

Пълното внедряване на Mihu On-Premise се състои от няколко независими услуги. Всички основни компоненти се доставят като контейнеризирани Docker услуги и се внедряват в Kubernetes с Rancher или Helm.

01

### Mihu Core

Основна среда за изпълнение на AI агентите и бизнес логиката.

02

### Mihu Orchestration

Координира речевите модели, LLM, агентите и услугите по време на изпълнение.

03

### Mihu Relay

Слой за комуникация в реално време между услугите и сесиите на агентите.

04

### SIP инфраструктура

Обслужва корпоративната телефония и SIP свързаността.

05

### Услуги за масови комуникации

Поддържа изходящи комуникации и натоварвания с голям обем.

06

### Action Server

Изпълнява инструменти, интеграции и действия на агентите.

07

### Управление / уеб приложение

Интерфейс за администриране, конфигуриране и оперативно управление.

08

### Инфраструктура за бази данни

Постоянно съхранение на приложни и оперативни данни.

09

### Redis инфраструктура

Състояние в реално време, кеширане и разпределена координация при изпълнение.

### Допълнителна инфраструктура

Допълнителни възможности на Mihu също могат да бъдат внедрени on-premise. Тези компоненти изискват допълнителен сървърен капацитет в зависимост от използването.

### Mihu Builder

За генериране и изпълнение на персонализирани услуги, код, интеграции и работни процеси. Изпълнението на Builder изисква допълнителен GPU капацитет на сървъра.

### Mihu MCP Server

За предоставяне на работното пространство и възможностите на Mihu към съвместими с MCP AI системи.

### PBX Connector Server

Свързва съществуващата ви PBX или телефонна система с SIP инфраструктурата на Mihu за входящи и изходящи обаждания.

### SMTP сървър

Необходим, ако желаете да свържете имейл канала. Имейлите на агентите и известията се изпращат през вашия собствен SMTP сървър.

Наблюдаемост и логване

## Специализирана наблюдаемост за продукционни внедрявания

Продукционните внедрявания следва да включват специализирана инфраструктура за наблюдаемост. Mihu препоръчва отделна инфраструктура за централизирано логване и мониторинг.

### Централизирано логване

Логовете от Mihu Core, оркестрацията, SIP, relay, сървърите за модели и приложните услуги се събират централизирано.

### Мониторинг

Инфраструктурните и приложните метрики се наблюдават непрекъснато. При превишаване на предварително зададени оперативни прагове могат да се генерират известия.

Наблюдавани метрики

Натоварване на CPU

Използване на паметта

Натоварване на GPU

Капацитет на дисковете

Състояние на мрежата

Състояние на услугите

Латентност на инференса на моделите

Дължина на опашката

Инфраструктура за обаждания

Грешки в приложението

Мрежова архитектура

## Не се изисква външна свързаност

Всички услуги на Mihu работят на сървъри в собствената мрежа на клиента. За продукционна работа не се изисква VPN, тунел или постоянна връзка с Mihu.

Вътрешните AI услуги не се нуждаят от публично излагане. Телефонията достига до SIP инфраструктурата през съществуващата свързаност на клиента с оператора или PBX, а мрежовите правила се определят изцяло от инфраструктурните политики и политиките за сигурност на клиента.

Мрежа на клиента

Входни точки SIP trunk / PBX Уеб приложение API

Core / Orchestration / SIP

STT LLM TTS Действия

DB / Кеш / Съхранение

Операции Логове Известия Мониторинг

Инфраструктурни изисквания

## Базова продукционна конфигурация

За продукционна инсталация на Mihu On-Premise началната конфигурация на инфраструктурата се определя според очакваната едновременност и натоварвания.

### Изчислителни ресурси

128 vCPU

Препоръчителен минимум · основни услуги и гласов слой на CPU

+ GPU

В зависимост от избрания модел · напр. Kimi K2.6 Instant, Qwen, Llama или Mistral; препоръчаният модел може да се промени с времето

Базата от 128 vCPU покрива услугите Mihu Core и STT/TTS на CPU. Тя не покрива слоя за разсъждение: високопроизводителен самостоятелно хостван LLM като Kimi K2.6 Instant изисква отделна GPU инфраструктура в допълнение към тази база, оразмерена според избрания модел и очакваната едновременност. Изборът на по-малък модел с отворени тегла съответно намалява нуждата от GPU. GPU капацитет се добавя и когато са необходими многоезични гласови модели на GPU. Точното разпределение зависи от едновременните AI разговори, натоварването на STT/TTS, внедрените езици, избора на LLM, конфигурацията за резервираност и допълнителни услуги като Builder и MCP.

Разпределението на физически ядра спрямо vCPU се потвърждава в предложението за внедряване.

### Съхранение

обаждания × средна продължителност × формат на запис × срок на съхранение

Капацитет за записи

Изискванията към съхранението зависят преди всичко от това дали записите на обажданията и другите медийни файлове се съхраняват локално. Базите данни на приложението Mihu изискват постоянно съхранение, докато капацитетът за записи се изчислява отделно. Клиенти, които съхраняват записи в продължение на месеци или години, следва да осигурят отделен дисков обем, оразмерен според тяхната политика за съхранение.

Клиентите сами определят своите

съхранение на записи

съхранение на транскрипции

политика за резервни копия

политика за архивиране

политика за изтриване

### Висока наличност

99.9%

Целева оперативна наличност

Продукционната архитектура може да бъде конфигурирана с резервираност на критичните услуги на Mihu. Постигането на тази цел изисква договорената продукционна архитектура, резервираност и инфраструктурни изисквания да бъдат поддържани.

За корпоративните on-premise инсталации се определя специализирана оперативна отговорност. При липса на повреди в базовата инфраструктура или хардуера, които са извън оперативната отговорност на Mihu, внедряването е проектирано към договорената цел за наличност на услугата от 99,9%. Отговорностите по отделните слоеве са определени в документа SLA.

Внедряване

## Предварително конфигурирано, в Docker контейнери, доставено съвместно с вашия инфраструктурен екип

Целият стек на Mihu се предоставя като предварително конфигурирани Docker услуги. Инженерният екип на Mihu отговаря за конфигурацията на внедряването и готовността за продукция заедно с инфраструктурния екип на клиента. Типично on-premise внедряване се доставя за 3–6 месеца — от подготовката на инфраструктурата до продукция — и е достъпно за enterprise клиенти.

Подготовка на инфраструктурата

Конфигуриране на мрежата

Услуги на Mihu

Речеви модели

LLM

Телефония

Съхранение

Наблюдаемост

Валидиране

Продукция

Kubernetes: стекът може да бъде внедрен с Helm charts. Стандартният и най-бърз подход на Mihu е внедряване на Kubernetes, управлявано с Rancher.

### Версии и издания

Mihu On-Premise използва версиониране на базата на клонове: всяко клиентско внедряване работи в собствен release клон, а актуализациите се доставят като месечни издания. Всяко издание се валидира преди внедряване и се прилага в координация с инфраструктурния екип на клиента, така че надгражданията се планират, а не се налагат. Валидирането на изданието обхваща стандартния набор от тестове; някои unit тестове може да се различават в зависимост от специфичните за клиента персонализации.

### Специализиран екип за поддръжка

За всяка on-premise среда Mihu определя екип по customer success и DevOps екип, които работят заедно с вашия екип. Поддръжката протича през обща Slack група, така че оперативните въпроси, координацията на изданията и инцидентите се решават директно с хората, които познават вашето внедряване.

## Всичко остава вътре.

Обобщен преглед на една страница какво къде работи при внедряване на Mihu On-Premise.

Реч On-premise

Mihu STT CPU

Mihu TTS CPU

Клониране на глас Частно

LLM Отворени тегла / самостоятелно хостван

Fine-tuning Върху инфраструктурата на клиента

Телефония SIP

Данни Под контрола на клиента

Записи Под контрола на клиента

База данни On-premise

Интеграции Action Server on-premise

Внедряване В Docker контейнери · Kubernetes (Rancher / Helm)

Свързаност Вътре в мрежата на клиента

Наблюдаемост Специализирана

Целева стойност по SLA 99.9%

Доставка 3–6 месеца до продукция

Достъпност Enterprise клиенти

Поддръжка Екип по customer success + DevOps, обща Slack група

Издания Месечни, версиониране по клонове

Често задавани въпроси

## Mihu AI On-Premise — често задавани въпроси

Какво всъщност работи в нашата инфраструктура?

Целият стек: Speech-to-Text, Text-to-Speech, клониране на глас, LLM слоят за разсъждение, оркестрацията, SIP телефонията, Action Server за интеграции, приложението за управление, както и слоевете с база данни и Redis. Клиентските данни не е необходимо да напускат вашата среда.

Необходими ли са ни GPU?

Не и за речевия слой. STT и TTS работят на CPU с модели от приблизително 66M до 143M параметъра. Високопроизводителните LLM с отворени тегла по правило изискват GPU инфраструктура, а GPU капацитет се добавя и ако изберете по-големи многоезични речеви модели.

Кои езици поддържа речевият стек on-premise?

Настоящият on-premise гласов стек на CPU поддържа седем езика: английски, немски, френски, испански, италиански, руски и турски. Тези специфични за езика модели Mihu STT и Mihu TTS работят на CPU, без GPU. Mihu STT обикновено постига около 5–9% процент грешки в думите (WER); точната стойност зависи от езика и от набора от данни за оценка.

Кой LLM се използва и може ли да бъде сменен по-късно?

Слоят за разсъждение не зависи от конкретен модел и работи с модели с отворени тегла. Mihu препоръчва модел към датата на внедряване, а за да се покрият изисквания за доставка или за произхода на модела, могат да бъдат избрани алтернативи от различни доставчици и региони, например Llama или Mistral наред с Kimi K2.6 Instant. Моделът може да бъде актуализиран или заменен независимо от останалата част от инфраструктурата на агентите, когато станат достъпни по-добри модели с отворени тегла.

Можем ли да извършим fine-tuning на речевите модели със собствени данни?

Да. Поддържаните STT и TTS модели могат да бъдат донастроени върху инфраструктура, контролирана от клиента, с ваши собствени набори от данни, така че собственото аудио никога не достига до външен доставчик. Получените модели остават частни за вашата организация.

От каква инфраструктура се нуждаем, за да започнем?

Типична производствена база започва от 128 vCPU за основните услуги на Mihu и гласовия слой на CPU. Самостоятелно хостваният LLM се оразмерява отделно и изисква отделна GPU инфраструктура в допълнение към тази база; GPU капацитет се добавя и за многоезични гласови модели на GPU. Съхранението се оразмерява според вашата политика за съхранение на записи и транскрипции. Точното оразмеряване се потвърждава в предложението за внедряване.

Как се доставя и свързва внедряването?

Всичко се доставя като предварително конфигурирани Docker услуги и работи на собствените сървъри на клиента. За продукционна работа не се изисква VPN или обратна връзка към Mihu и никоя вътрешна AI услуга не се нуждае от публично излагане. Инженерният екип на Mihu извършва конфигурацията на внедряването заедно с вашия инфраструктурен екип.

Можете ли да обучите STT и TTS за език извън настоящите седем?

Да. Нови езици могат да бъдат добавени при заявка. Усилието за обучение се различава според езиковата група, а STT и TTS се обучават отделно. Mihu може да осигури или закупи набора от данни за обучение за вас, или да работи с данни, които предоставите. Обучението се извършва на машини, предоставени от вас, или на инфраструктура, осигурена от Mihu, а получените модели Mihu STT и Mihu TTS след това се внедряват във вашата среда точно както стандартните.

## Планирате on-premise внедряване?

Споделете очакваната едновременност, езиците и изискванията за местоположение на данните. Нашият инженерен екип ще се върне при Вас с предложение за оразмеряване и план за внедряване.

Свържете се с търговския екип (https://mihu.ai/bg/contact)
