Mihu AI On-Premise

Państwa agenci. Państwa modele. Państwa głosy. Państwa infrastruktura. Państwa dane.

Mihu uruchamia pełny stos agentów AI — od mowy i rozumowania po telefonię i działania — wewnątrz Państwa infrastruktury. Dane klientów nie muszą opuszczać Państwa środowiska.

7
Języki mowy on-premise
CPU
Inferencja Mihu STT i TTS
99.9%
Docelowa dostępność
Granica wdrożenia
Wewnątrz Państwa sieci
Telefonia
Infrastruktura SIP, usługi broadcast
Lokalnie
Mowa
Mihu STT, Mihu TTS i klonowanie głosu na CPU
Lokalnie
Rozumowanie
LLM open-weight, hostowany samodzielnie
Lokalnie
Działania
Action Server, integracje, przepływy pracy
Lokalnie
Dane
Baza danych, Redis, nagrania, transkrypcje
Lokalnie
Przegląd

Prywatna infrastruktura głosowa AI wdrożona w całości wewnątrz Państwa środowiska.

Mihu AI On-Premise to oferta korporacyjna, która umożliwia organizacjom uruchomienie pełnego stosu agentów Mihu AI we własnej infrastrukturze.

Przetwarzanie mowy, inferencja AI, orkiestracja, telefonia, integracje, usługi aplikacyjne i przechowywanie danych mogą działać bez opuszczania środowiska organizacji przez dane klientów.

Całe wdrożenie jest dostarczane jako skonteneryzowane usługi Docker i działa w infrastrukturze zarządzanej przez klienta, wdrożone na Kubernetes za pomocą Rancher lub Helm.

Mowa
On-premise, inferencja na CPU
LLM
Open weights, hostowane samodzielnie
Telefonia
SIP wewnątrz Państwa sieci
Dane
Przechowywanie kontrolowane przez klienta
Infrastruktura mowy

Mihu STT i Mihu TTS, w pełni on-premise.

Mihu dostarcza własne modele mowy — Mihu STT (Speech-to-Text) i Mihu TTS (Text-to-Speech) — w pełni on-premise. W obsługiwanych wdrożeniach:

  • Mihu STT (Speech-to-Text) działa lokalnie.
  • Mihu TTS (Text-to-Speech) działa lokalnie.
  • Warstwa mowy obsługuje inferencję wyłącznie na CPU.
  • Zewnętrzne API mowy nie jest wymagane.
  • Klonowanie głosu może zostać wdrożone wewnątrz infrastruktury klienta.
  • Materiały audio i dane treningowe klienta mogą pozostać w całości w środowisku klienta.
Obecny stos mowy on-premise · 7 języków
angielski niemiecki francuski hiszpański włoski rosyjski turecki

Te 7 języków działa w całości na własnych modelach STT i TTS Mihu, w Państwa infrastrukturze. Platforma chmurowa Mihu obsługuje ponad 40 języków dzięki dodatkowym modelom mowy.

5–9%
Typowy współczynnik błędów słów (WER) obecnych wdrożeń Mihu STT (Speech-to-Text), zależny od języka i zbioru ewaluacyjnego.

Lekkie modele mowy dla CPU

Infrastruktura mowy Mihu została zaprojektowana tak, aby ograniczyć wymagania inferencji. W zależności od języka i konfiguracji modelu wdrażane modele mowy mają około 66M – 143M parametrów.

Dzięki temu obciążenia STT i TTS mogą działać na infrastrukturze CPU bez konieczności przydzielania dedykowanego GPU do każdego obciążenia głosowego.

Rzeczywista wydajność zależy od
  • liczby równoczesnych rozmów
  • wybranego języka
  • wybranego modelu STT/TTS
  • konfiguracji audio
  • docelowego opóźnienia
  • wymagań dotyczących redundancji

Wartości równoczesności ustalane są dla każdego wdrożenia na podstawie testów wydajnościowych na docelowym sprzęcie, a nie podawane jako stały stosunek CPU do liczby połączeń.

Dostosowanie

Prywatny fine-tuning i klonowanie głosu

Własne dane mowy i głosy marki pozostają w infrastrukturze kontrolowanej przez Państwa.

Prywatny fine-tuning

Organizacje dysponujące wysokiej jakości własnymi danymi mowy mogą dodatkowo dostosować warstwę mowy. Mihu może przeprowadzić fine-tuning obsługiwanych modeli STT/TTS bezpośrednio w infrastrukturze kontrolowanej przez klienta, dzięki czemu zastrzeżone zbiory danych nie muszą być przekazywane zewnętrznemu dostawcy inferencji.

Modele niestandardowe mogą być
  • dostrajane przy użyciu zbiorów danych dostarczonych przez klienta
  • optymalizowane pod kątem terminologii branżowej
  • dostosowywane do akcentów i mowy specyficznej dla danej dziedziny
  • wdrażane wyłącznie wewnątrz infrastruktury klienta
  • utrzymywane prywatnie, w całości w Państwa własnej infrastrukturze

Szczególnie przydatne dla organizacji ze specjalistycznym słownictwem, regionalnymi akcentami lub rygorystycznymi wymaganiami dotyczącymi lokalizacji danych.

Klonowanie głosu

Mihu On-Premise obsługuje również prywatne klonowanie głosu. Dostarczone próbki głosu mogą posłużyć do utworzenia głosów specyficznych dla organizacji, które następnie są hostowane we własnej infrastrukturze klienta.

Zarówno nagrania źródłowe, jak i powstały model głosu mogą pozostać prywatne.

Pozwala to przedsiębiorstwom tworzyć spójne głosy marki bez korzystania z zewnętrznego dostawcy TTS podczas inferencji produkcyjnej.

Wymaganie dotyczące próbki głosu: około 30 sekund czystej mowy, nagranej bez długich pauz ani przerw między zdaniami.

Architektura wielojęzyczna

Modele dedykowane językowo na CPU lub wielojęzyczne na GPU

Lekkie modele mowy dla CPU są przede wszystkim dedykowane poszczególnym językom i nie stanowią jednego modelu wielojęzycznego. Dla agentów AI, którzy muszą dynamicznie zmieniać język w trakcie tej samej interakcji, Mihu obsługuje kilka strategii wdrożenia.

Efektywność CPU

Orkiestracja modeli

Wiele modeli mowy dedykowanych poszczególnym językom działa jednocześnie. Warstwa orkiestracji Mihu wykrywa lub otrzymuje aktywny język i dynamicznie kieruje przetwarzanie mowy do właściwego modelu.

Wybór modelu w trakcie interakcji może być również sterowany nadpisaniami na poziomie systemu.

Maksymalna elastyczność wielojęzyczna

Wielojęzyczne modele GPU

W scenariuszach wymagających wysoce dynamicznych rozmów wielojęzycznych można zamiast tego wdrożyć większe wielojęzyczne modele mowy na infrastrukturze GPU.

Architektura jest optymalizowana pod kątem efektywności CPU z modelami dedykowanymi językowo albo maksymalnej elastyczności wielojęzycznej z modelami GPU, w zależności od obciążenia.

Uwaga: wielojęzyczne STT i wielojęzyczne TTS wymagają infrastruktury GPU. Ścieżka mowy wyłącznie na CPU dotyczy modeli Mihu STT i Mihu TTS specyficznych dla języka.

Lokalna infrastruktura LLM

Warstwa rozumowania działa na modelach open-weight wewnątrz Państwa środowiska.

Warstwa rozumowania działa w całości wewnątrz Państwa środowiska na modelach LLM open-weight: modelach, których wagi zostały publicznie udostępnione i które mogą działać całkowicie offline na Państwa własnym sprzęcie, bez połączenia z dostawcą modelu. Mihu na bieżąco ocenia nowe modele open-weight, zamiast trwale wiązać stos on-premise z jedną rodziną modeli.

Wydajne wdrożenia LLM zazwyczaj wymagają infrastruktury GPU. Rekomendowany model może się zmieniać wraz z pojawianiem się nowych modeli, a Mihu może aktualizować lub wymieniać model rozumowania niezależnie od pozostałej części infrastruktury agentów.

Infrastruktura jest niezależna od modelu. Najlepszy dostępny model może się zmienić; Państwa architektura nie musi.

Rekomendowana konfiguracja na dzień wdrożenia

Model wnioskowania jest wybierany w momencie wdrożenia z bieżącego zestawu ewaluacyjnego. Według stanu na wrzesień 2026 jedną z naszych preferowanych wydajnych konfiguracji jest Kimi K2.6 Instant. Działa on na dedykowanej infrastrukturze GPU, udostępnianej dodatkowo ponad bazę 128 vCPU. Tam, gdzie obowiązują wymagania dotyczące zakupu lub pochodzenia modelu, można wybrać alternatywy open-weight od innych dostawców i z innych regionów, takie jak Llama lub Mistral. Wybór jest potwierdzany w każdej propozycji wdrożenia.

Infrastruktura Mihu Core

Z czego składa się pełne wdrożenie

Pełne wdrożenie Mihu On-Premise składa się z kilku niezależnych usług. Wszystkie komponenty podstawowe są dostarczane jako skonteneryzowane usługi Docker i wdrażane na Kubernetes za pomocą Rancher lub Helm.

01

Mihu Core

Podstawowe środowisko uruchomieniowe agentów AI i logika biznesowa.

02

Mihu Orchestration

Koordynuje modele mowy, modele LLM, agentów i usługi uruchomieniowe.

03

Mihu Relay

Warstwa komunikacji w czasie rzeczywistym pomiędzy usługami a sesjami agentów.

04

Infrastruktura SIP

Obsługuje telefonię korporacyjną i łączność SIP.

05

Usługi broadcast

Obsługuje wychodzące i wysokowolumenowe obciążenia komunikacyjne.

06

Action Server

Wykonuje narzędzia, integracje i działania agentów.

07

Aplikacja zarządzająca / webowa

Interfejs administracji, konfiguracji i zarządzania operacyjnego.

08

Infrastruktura bazy danych

Trwałe przechowywanie danych aplikacyjnych i operacyjnych.

09

Infrastruktura Redis

Stan w czasie rzeczywistym, buforowanie i rozproszona koordynacja środowiska uruchomieniowego.

Infrastruktura opcjonalna

Dodatkowe funkcje Mihu również mogą zostać wdrożone on-premise. Komponenty te wymagają dodatkowej pojemności serwerowej w zależności od wykorzystania.

Mihu Builder

Do generowania i uruchamiania własnych usług, kodu, integracji i przepływów pracy. Uruchomienie Buildera wymaga dodatkowej pojemności GPU na serwerze.

Mihu MCP Server

Do udostępniania przestrzeni roboczej Mihu i jej funkcji systemom AI zgodnym z MCP.

PBX Connector Server

Łączy istniejącą centralę PBX lub system telefoniczny z infrastrukturą SIP Mihu na potrzeby połączeń przychodzących i wychodzących.

Serwer SMTP

Wymagany, jeśli chcą Państwo podłączyć kanał e-mail. Wiadomości agentów i powiadomienia są wysyłane przez Państwa własny serwer SMTP.

Obserwowalność i logowanie

Dedykowana obserwowalność dla wdrożeń produkcyjnych

Wdrożenia produkcyjne powinny obejmować dedykowaną infrastrukturę obserwowalności. Mihu zaleca odrębną infrastrukturę do scentralizowanego logowania i monitorowania.

Scentralizowane logowanie

Logi z Mihu Core, warstwy orkiestracji, SIP, relay, serwerów modeli i usług aplikacyjnych są zbierane centralnie.

Monitorowanie

Metryki infrastruktury i aplikacji są monitorowane w sposób ciągły. Po przekroczeniu zdefiniowanych progów operacyjnych mogą być generowane alerty.

Monitorowane metryki
  • Wykorzystanie CPU
  • Wykorzystanie pamięci
  • Wykorzystanie GPU
  • Pojemność dysku
  • Kondycja sieci
  • Kondycja usług
  • Opóźnienie inferencji modeli
  • Głębokość kolejki
  • Infrastruktura połączeń
  • Błędy aplikacji
Architektura sieci

Brak wymagań dotyczących łączności zewnętrznej

Wszystkie usługi Mihu działają na serwerach we własnej sieci klienta. Do pracy produkcyjnej nie jest wymagany VPN, tunel ani stałe połączenie z Mihu.

Wewnętrzne usługi AI nie wymagają publicznego udostępnienia. Telefonia dociera do infrastruktury SIP przez istniejące połączenie klienta z operatorem lub centralą PBX, a reguły sieciowe są definiowane w całości przez politykę infrastruktury i bezpieczeństwa klienta.

Sieć klienta
Punkty wejściaSIP trunk / PBXAplikacja webAPI
Core / Orchestration / SIP
STTLLMTTSDziałania
DB / Cache / Pamięć masowa
OperacjeLogiPowiadomieniaMonitorowanie
Wymagania infrastrukturalne

Bazowa konfiguracja produkcyjna

Dla produkcyjnej instalacji Mihu On-Premise początkowa konfiguracja infrastruktury jest ustalana na podstawie oczekiwanej liczby równoczesnych rozmów i obciążeń.

Moc obliczeniowa

128 vCPU
Zalecane minimum · usługi podstawowe i warstwa mowy na CPU
+ GPU
W zależności od wybranego modelu · np. Kimi K2.6 Instant, Qwen, Llama lub Mistral; zalecany model może się zmieniać w czasie

Baza 128 vCPU obejmuje usługi Mihu Core oraz STT/TTS na CPU. Nie obejmuje warstwy wnioskowania: wydajny, samodzielnie hostowany LLM, taki jak Kimi K2.6 Instant, wymaga dedykowanej infrastruktury GPU ponad tę bazę, dobranej do wybranego modelu i oczekiwanej współbieżności. Wybór mniejszego modelu open-weight odpowiednio zmniejsza zapotrzebowanie na GPU. Pojemność GPU jest dodawana także wtedy, gdy wymagane są wielojęzyczne modele mowy na GPU. Dokładna alokacja zależy od liczby równoczesnych rozmów AI, obciążenia STT/TTS, wdrożonych języków, wyboru LLM, konfiguracji redundancji oraz usług dodatkowych, takich jak Builder i MCP.

Podział na rdzenie fizyczne i vCPU jest potwierdzany w propozycji wdrożenia.

Przestrzeń dyskowa

połączenia × średni czas trwania × format nagrania × okres przechowywania
Pojemność na nagrania

Wymagania dotyczące przestrzeni dyskowej zależą przede wszystkim od tego, czy nagrania rozmów i inne materiały są przechowywane lokalnie. Bazy danych aplikacji Mihu wymagają trwałej przestrzeni dyskowej, natomiast pojemność na nagrania jest wyliczana osobno. Klienci przechowujący nagrania przez miesiące lub lata powinni przewidzieć dedykowany wolumen dyskowy o rozmiarze odpowiadającym ich polityce przechowywania.

Klienci samodzielnie definiują
  • okres przechowywania nagrań
  • okres przechowywania transkrypcji
  • politykę kopii zapasowych
  • politykę archiwizacji
  • politykę usuwania danych

Wysoka dostępność

99.9%
Docelowa dostępność operacyjna

Architektura produkcyjna może zostać skonfigurowana z redundancją kluczowych usług Mihu. Osiągnięcie tego celu wymaga utrzymania uzgodnionej architektury produkcyjnej, redundancji i wymagań infrastrukturalnych.

Dla korporacyjnych instalacji on-premise przypisywana jest dedykowana odpowiedzialność operacyjna. W przypadku braku awarii infrastruktury bazowej lub sprzętu pozostających poza odpowiedzialnością operacyjną Mihu wdrożenie jest projektowane pod kątem uzgodnionego celu dostępności usługi na poziomie 99.9%. Zakres odpowiedzialności poszczególnych warstw określa dokument SLA.

Wdrożenie

Wstępnie skonfigurowane, w kontenerach Docker, dostarczane wspólnie z Państwa zespołem infrastrukturalnym

Pełny stos Mihu jest dostarczany jako wstępnie skonfigurowane usługi Docker. Zespół inżynierów Mihu odpowiada za konfigurację wdrożenia i gotowość produkcyjną wspólnie z zespołem infrastrukturalnym klienta. Typowe wdrożenie on-premise jest realizowane w 3–6 miesięcy, od przygotowania infrastruktury po produkcję, i jest dostępne dla klientów korporacyjnych.

  1. Przygotowanie infrastruktury
  2. Konfiguracja sieci
  3. Usługi Mihu
  4. Modele mowy
  5. LLM
  6. Telefonia
  7. Przestrzeń dyskowa
  8. Obserwowalność
  9. Walidacja
  10. Produkcja

Kubernetes: stos można wdrożyć przy użyciu chartów Helm. Standardową i najszybszą ścieżką Mihu jest wdrożenie Kubernetes zarządzane przez Rancher.

Wersjonowanie i wydania

Mihu On-Premise stosuje wersjonowanie oparte na gałęziach: każde wdrożenie klienta działa na własnej gałęzi wydania, a aktualizacje są dostarczane jako wydania miesięczne. Każde wydanie jest walidowane przed wdrożeniem i wdrażane w koordynacji z zespołem infrastruktury klienta, dzięki czemu aktualizacje są planowane, a nie wymuszane. Walidacja wydania obejmuje standardowy zestaw testów; niektóre testy jednostkowe mogą się różnić w zależności od dostosowań specyficznych dla klienta.

Dedykowany zespół wsparcia

Do każdego środowiska on-premise Mihu przydziela zespół customer success oraz zespół DevOps, które pracują wspólnie z Państwa zespołem. Wsparcie prowadzone jest przez wspólną grupę na Slacku, dzięki czemu pytania operacyjne, koordynacja wydań i incydenty są obsługiwane bezpośrednio przez osoby znające Państwa wdrożenie.

Wszystko pozostaje wewnątrz.

Jednostronicowy przegląd tego, co i gdzie działa we wdrożeniu Mihu On-Premise.

MowaOn-premise
Mihu STTCPU
Mihu TTSCPU
Klonowanie głosuPrywatne
LLMOpen weights / hostowane samodzielnie
Fine-tuningW infrastrukturze klienta
TelefoniaSIP
DaneKontrolowane przez klienta
NagraniaKontrolowane przez klienta
Baza danychOn-premise
IntegracjeAction Server on-premise
WdrożenieW kontenerach Docker · Kubernetes (Rancher / Helm)
ŁącznośćWewnątrz sieci klienta
ObserwowalnośćDedykowana
Docelowy poziom SLA99.9%
Dostarczenie3–6 miesięcy do produkcji
DostępnośćKlienci korporacyjni
WsparcieZespół customer success + DevOps, wspólna grupa na Slacku
WydaniaMiesięczne, wersjonowanie oparte na gałęziach
FAQ

Mihu AI On-Premise — Najczęściej zadawane pytania

Co dokładnie działa wewnątrz naszej infrastruktury?

Pełny stos: Speech-to-Text, Text-to-Speech, klonowanie głosu, warstwa rozumowania LLM, orkiestracja, telefonia SIP, Action Server do integracji, aplikacja zarządzająca oraz warstwy bazy danych i Redis. Dane klientów nie muszą opuszczać Państwa środowiska.

Czy potrzebujemy GPU?

Nie w warstwie mowy. STT i TTS działają na CPU z modelami o wielkości od około 66M do 143M parametrów. Wydajne modele LLM open-weight zazwyczaj wymagają infrastruktury GPU, a pojemność GPU jest dodawana również w przypadku wyboru większych wielojęzycznych modeli mowy.

Jakie języki obsługuje stos mowy on-premise?

Obecny stos mowy on-premise działający na CPU obsługuje siedem języków: angielski, niemiecki, francuski, hiszpański, włoski, rosyjski i turecki. Te modele Mihu STT i Mihu TTS dla poszczególnych języków działają na CPU, bez GPU. Mihu STT osiąga zazwyczaj około 5–9% współczynnika błędów słów (WER); dokładna wartość zależy od języka i zbioru danych ewaluacyjnych.

Który model LLM jest wykorzystywany i czy można go później zmienić?

Warstwa rozumowania jest niezależna od modelu i działa na modelach open-weight. Mihu rekomenduje model na dzień wdrożenia, a w celu spełnienia wymagań dotyczących zakupu lub pochodzenia modelu można wybrać alternatywy od innych dostawców i z innych regionów, na przykład Llama lub Mistral obok Kimi K2.6 Instant. Model można aktualizować lub wymieniać niezależnie od pozostałej części infrastruktury agentów, gdy pojawią się lepsze modele open-weight.

Czy możemy przeprowadzić fine-tuning modeli mowy na własnych danych?

Tak. Obsługiwane modele STT i TTS mogą być dostrajane w infrastrukturze kontrolowanej przez klienta z użyciem Państwa własnych zbiorów danych, dzięki czemu zastrzeżone materiały audio nigdy nie trafiają do zewnętrznego dostawcy. Powstałe modele pozostają prywatne dla Państwa organizacji.

Jakiej infrastruktury potrzebujemy na start?

Typowa baza produkcyjna zaczyna się od 128 vCPU dla podstawowych usług Mihu i warstwy mowy na CPU. Samodzielnie hostowany LLM jest wymiarowany osobno i wymaga dedykowanej infrastruktury GPU ponad tę bazę; pojemność GPU jest dodawana także dla wielojęzycznych modeli mowy na GPU. Pamięć masowa jest wymiarowana na podstawie Państwa polityki retencji nagrań i transkrypcji. Dokładne wymiarowanie jest potwierdzane w propozycji wdrożenia.

W jaki sposób wdrożenie jest dostarczane i podłączane?

Wszystko jest dostarczane jako wstępnie skonfigurowane usługi Docker i działa na własnych serwerach klienta. Do pracy produkcyjnej nie jest wymagany VPN ani połączenie zwrotne z Mihu, a żadna wewnętrzna usługa AI nie wymaga publicznego udostępnienia. Zespół inżynierski Mihu zajmuje się konfiguracją wdrożenia wspólnie z Państwa zespołem infrastruktury.

Czy możecie wytrenować STT i TTS dla języka spoza obecnych siedmiu?

Tak. Nowe języki można dodać na życzenie. Nakład pracy zależy od grupy językowej, a STT i TTS są trenowane osobno. Mihu może dostarczyć lub zakupić zbiór danych treningowych dla Państwa albo pracować na danych przez Państwa dostarczonych. Trening odbywa się na maszynach udostępnionych przez Państwa lub na infrastrukturze zapewnionej przez Mihu, a powstałe modele Mihu STT i Mihu TTS są następnie wdrażane w Państwa środowisku dokładnie tak jak modele standardowe.

Planują Państwo wdrożenie on-premise?

Prosimy o przekazanie oczekiwanej liczby równoczesnych rozmów, języków i wymagań dotyczących lokalizacji danych. Nasz zespół inżynierów przedstawi propozycję doboru zasobów i plan wdrożenia.