Mihu работи с целия стек от AI агенти — от реч и разсъждение до телефония и действия — във вашата инфраструктура. Клиентските данни не е необходимо да напускат вашата среда.
Mihu AI On-Premise е enterprise предложение, което позволява на организациите да работят с целия стек от AI агенти на Mihu в собствената си инфраструктура.
Обработката на реч, AI инференсът, оркестрацията, телефонията, интеграциите, приложните услуги и съхранението на данни могат да функционират, без клиентските данни да напускат средата на организацията.
Цялото внедряване се доставя като контейнеризирани Docker услуги и работи върху управлявана от клиента инфраструктура, внедрено в Kubernetes с Rancher или Helm.
Mihu предоставя собствените си гласови модели — Mihu STT (Speech-to-Text) и Mihu TTS (Text-to-Speech) — изцяло on-premise. За поддържаните внедрявания:
Тези 7 езика работят изцяло върху собствените STT и TTS модели на Mihu, във вашата инфраструктура. Облачната платформа на Mihu поддържа над 40 езика чрез допълнителни гласови модели.
Речевата инфраструктура на Mihu е проектирана така, че изискванията към инференса да остават ниски. В зависимост от езика и конфигурацията на модела, внедрените речеви модели са с приблизително 66M – 143M параметъра.
Това позволява STT и TTS натоварванията да се изпълняват върху CPU инфраструктура, без да е необходим отделен GPU за всяко гласово натоварване.
Стойностите за едновременност се определят за всяко внедряване чрез бенчмаркове върху целевия хардуер, а не се посочват като фиксирано съотношение между CPU и обаждания.
Собствените речеви данни и фирмените гласове остават върху инфраструктура, която Вие контролирате.
Организации с висококачествени собствени речеви данни могат допълнително да персонализират речевия слой. Mihu може да извърши fine-tuning на поддържаните STT/TTS модели директно върху инфраструктура, контролирана от клиента, така че собствените набори от данни да не се прехвърлят към външен доставчик на инференс.
Особено полезно за организации със специализирана терминология, регионални акценти или строги изисквания за местоположение на данните.
Mihu On-Premise поддържа и частно клониране на глас. Предоставените гласови проби могат да се използват за създаване на специфични за организацията гласове, които след това се хостват в собствената инфраструктура на клиента.
Както изходните записи, така и полученият гласов модел могат да останат частни.
Това позволява на предприятията да създават последователни фирмени гласове, без да разчитат на външен TTS доставчик по време на продукционния инференс.
Изискване за гласовата проба: около 30 секунди чиста реч, записана без дълги паузи или празнини между изреченията.
Леките речеви модели за CPU са предимно специфични за отделен език, а не един многоезичен модел. За AI агенти, които трябва да превключват езици динамично в рамките на едно и също взаимодействие, Mihu поддържа няколко стратегии за внедряване.
Няколко специфични за езика речеви модела работят едновременно. Слоят за оркестрация на Mihu разпознава или получава активния език и динамично насочва обработката на реч към подходящия модел.
Изборът на модел може да се управлява и чрез системни настройки, приложени по време на взаимодействието.
За сценарии, изискващи силно динамични многоезични разговори, вместо това могат да бъдат внедрени по-големи многоезични речеви модели върху GPU инфраструктура.
Архитектурата се оптимизира или за ефективност на CPU със специфични за езика модели, или за максимална многоезична гъвкавост с модели, базирани на GPU, в зависимост от натоварването.
Забележка: многоезичният STT и многоезичният TTS изискват GPU инфраструктура. Пътят само на CPU се отнася за езиково специфичните модели Mihu STT и Mihu TTS.
Слоят за разсъждение работи изцяло във вашата среда с LLM с отворени тегла: модели, чиито тегла са публично достъпни и които могат да работят напълно офлайн на ваш собствен хардуер, без връзка с доставчика на модела. Mihu непрекъснато оценява нови модели с отворени тегла, вместо да обвързва трайно on-premise стека с едно семейство модели.
Високопроизводителните LLM внедрявания по правило изискват GPU инфраструктура. Препоръчваният модел може да се промени с появата на нови модели, а Mihu може да актуализира или замени модела за разсъждение независимо от останалата част от инфраструктурата на агентите.
Инфраструктурата не зависи от конкретен модел. Най-добрият наличен модел може да се промени; вашата архитектура не е необходимо да се променя.
Моделът за разсъждение се избира при внедряването от текущия набор за оценка. Към септември 2026 г. една от предпочитаните ни високопроизводителни конфигурации е Kimi K2.6 Instant. Той работи върху отделна GPU инфраструктура, осигурена в допълнение към базата от 128 vCPU. Когато има изисквания за доставка или за произхода на модела, могат да бъдат избрани алтернативи с отворени тегла от други доставчици и региони, като Llama или Mistral. Изборът се потвърждава във всяко предложение за внедряване.
Пълното внедряване на Mihu On-Premise се състои от няколко независими услуги. Всички основни компоненти се доставят като контейнеризирани Docker услуги и се внедряват в Kubernetes с Rancher или Helm.
Основна среда за изпълнение на AI агентите и бизнес логиката.
Координира речевите модели, LLM, агентите и услугите по време на изпълнение.
Слой за комуникация в реално време между услугите и сесиите на агентите.
Обслужва корпоративната телефония и SIP свързаността.
Поддържа изходящи комуникации и натоварвания с голям обем.
Изпълнява инструменти, интеграции и действия на агентите.
Интерфейс за администриране, конфигуриране и оперативно управление.
Постоянно съхранение на приложни и оперативни данни.
Състояние в реално време, кеширане и разпределена координация при изпълнение.
Допълнителни възможности на Mihu също могат да бъдат внедрени on-premise. Тези компоненти изискват допълнителен сървърен капацитет в зависимост от използването.
За генериране и изпълнение на персонализирани услуги, код, интеграции и работни процеси. Изпълнението на Builder изисква допълнителен GPU капацитет на сървъра.
За предоставяне на работното пространство и възможностите на Mihu към съвместими с MCP AI системи.
Свързва съществуващата ви PBX или телефонна система с SIP инфраструктурата на Mihu за входящи и изходящи обаждания.
Необходим, ако желаете да свържете имейл канала. Имейлите на агентите и известията се изпращат през вашия собствен SMTP сървър.
Продукционните внедрявания следва да включват специализирана инфраструктура за наблюдаемост. Mihu препоръчва отделна инфраструктура за централизирано логване и мониторинг.
Логовете от Mihu Core, оркестрацията, SIP, relay, сървърите за модели и приложните услуги се събират централизирано.
Инфраструктурните и приложните метрики се наблюдават непрекъснато. При превишаване на предварително зададени оперативни прагове могат да се генерират известия.
Всички услуги на Mihu работят на сървъри в собствената мрежа на клиента. За продукционна работа не се изисква VPN, тунел или постоянна връзка с Mihu.
Вътрешните AI услуги не се нуждаят от публично излагане. Телефонията достига до SIP инфраструктурата през съществуващата свързаност на клиента с оператора или PBX, а мрежовите правила се определят изцяло от инфраструктурните политики и политиките за сигурност на клиента.
За продукционна инсталация на Mihu On-Premise началната конфигурация на инфраструктурата се определя според очакваната едновременност и натоварвания.
Базата от 128 vCPU покрива услугите Mihu Core и STT/TTS на CPU. Тя не покрива слоя за разсъждение: високопроизводителен самостоятелно хостван LLM като Kimi K2.6 Instant изисква отделна GPU инфраструктура в допълнение към тази база, оразмерена според избрания модел и очакваната едновременност. Изборът на по-малък модел с отворени тегла съответно намалява нуждата от GPU. GPU капацитет се добавя и когато са необходими многоезични гласови модели на GPU. Точното разпределение зависи от едновременните AI разговори, натоварването на STT/TTS, внедрените езици, избора на LLM, конфигурацията за резервираност и допълнителни услуги като Builder и MCP.
Разпределението на физически ядра спрямо vCPU се потвърждава в предложението за внедряване.
Изискванията към съхранението зависят преди всичко от това дали записите на обажданията и другите медийни файлове се съхраняват локално. Базите данни на приложението Mihu изискват постоянно съхранение, докато капацитетът за записи се изчислява отделно. Клиенти, които съхраняват записи в продължение на месеци или години, следва да осигурят отделен дисков обем, оразмерен според тяхната политика за съхранение.
Продукционната архитектура може да бъде конфигурирана с резервираност на критичните услуги на Mihu. Постигането на тази цел изисква договорената продукционна архитектура, резервираност и инфраструктурни изисквания да бъдат поддържани.
За корпоративните on-premise инсталации се определя специализирана оперативна отговорност. При липса на повреди в базовата инфраструктура или хардуера, които са извън оперативната отговорност на Mihu, внедряването е проектирано към договорената цел за наличност на услугата от 99,9%. Отговорностите по отделните слоеве са определени в документа SLA.
Целият стек на Mihu се предоставя като предварително конфигурирани Docker услуги. Инженерният екип на Mihu отговаря за конфигурацията на внедряването и готовността за продукция заедно с инфраструктурния екип на клиента. Типично on-premise внедряване се доставя за 3–6 месеца — от подготовката на инфраструктурата до продукция — и е достъпно за enterprise клиенти.
Kubernetes: стекът може да бъде внедрен с Helm charts. Стандартният и най-бърз подход на Mihu е внедряване на Kubernetes, управлявано с Rancher.
Mihu On-Premise използва версиониране на базата на клонове: всяко клиентско внедряване работи в собствен release клон, а актуализациите се доставят като месечни издания. Всяко издание се валидира преди внедряване и се прилага в координация с инфраструктурния екип на клиента, така че надгражданията се планират, а не се налагат. Валидирането на изданието обхваща стандартния набор от тестове; някои unit тестове може да се различават в зависимост от специфичните за клиента персонализации.
За всяка on-premise среда Mihu определя екип по customer success и DevOps екип, които работят заедно с вашия екип. Поддръжката протича през обща Slack група, така че оперативните въпроси, координацията на изданията и инцидентите се решават директно с хората, които познават вашето внедряване.
Обобщен преглед на една страница какво къде работи при внедряване на Mihu On-Premise.
Целият стек: Speech-to-Text, Text-to-Speech, клониране на глас, LLM слоят за разсъждение, оркестрацията, SIP телефонията, Action Server за интеграции, приложението за управление, както и слоевете с база данни и Redis. Клиентските данни не е необходимо да напускат вашата среда.
Не и за речевия слой. STT и TTS работят на CPU с модели от приблизително 66M до 143M параметъра. Високопроизводителните LLM с отворени тегла по правило изискват GPU инфраструктура, а GPU капацитет се добавя и ако изберете по-големи многоезични речеви модели.
Настоящият on-premise гласов стек на CPU поддържа седем езика: английски, немски, френски, испански, италиански, руски и турски. Тези специфични за езика модели Mihu STT и Mihu TTS работят на CPU, без GPU. Mihu STT обикновено постига около 5–9% процент грешки в думите (WER); точната стойност зависи от езика и от набора от данни за оценка.
Слоят за разсъждение не зависи от конкретен модел и работи с модели с отворени тегла. Mihu препоръчва модел към датата на внедряване, а за да се покрият изисквания за доставка или за произхода на модела, могат да бъдат избрани алтернативи от различни доставчици и региони, например Llama или Mistral наред с Kimi K2.6 Instant. Моделът може да бъде актуализиран или заменен независимо от останалата част от инфраструктурата на агентите, когато станат достъпни по-добри модели с отворени тегла.
Да. Поддържаните STT и TTS модели могат да бъдат донастроени върху инфраструктура, контролирана от клиента, с ваши собствени набори от данни, така че собственото аудио никога не достига до външен доставчик. Получените модели остават частни за вашата организация.
Типична производствена база започва от 128 vCPU за основните услуги на Mihu и гласовия слой на CPU. Самостоятелно хостваният LLM се оразмерява отделно и изисква отделна GPU инфраструктура в допълнение към тази база; GPU капацитет се добавя и за многоезични гласови модели на GPU. Съхранението се оразмерява според вашата политика за съхранение на записи и транскрипции. Точното оразмеряване се потвърждава в предложението за внедряване.
Всичко се доставя като предварително конфигурирани Docker услуги и работи на собствените сървъри на клиента. За продукционна работа не се изисква VPN или обратна връзка към Mihu и никоя вътрешна AI услуга не се нуждае от публично излагане. Инженерният екип на Mihu извършва конфигурацията на внедряването заедно с вашия инфраструктурен екип.
Да. Нови езици могат да бъдат добавени при заявка. Усилието за обучение се различава според езиковата група, а STT и TTS се обучават отделно. Mihu може да осигури или закупи набора от данни за обучение за вас, или да работи с данни, които предоставите. Обучението се извършва на машини, предоставени от вас, или на инфраструктура, осигурена от Mihu, а получените модели Mihu STT и Mihu TTS след това се внедряват във вашата среда точно както стандартните.
Споделете очакваната едновременност, езиците и изискванията за местоположение на данните. Нашият инженерен екип ще се върне при Вас с предложение за оразмеряване и план за внедряване.