Mihu uruchamia pełny stos agentów AI — od mowy i rozumowania po telefonię i działania — wewnątrz Państwa infrastruktury. Dane klientów nie muszą opuszczać Państwa środowiska.
Mihu AI On-Premise to oferta korporacyjna, która umożliwia organizacjom uruchomienie pełnego stosu agentów Mihu AI we własnej infrastrukturze.
Przetwarzanie mowy, inferencja AI, orkiestracja, telefonia, integracje, usługi aplikacyjne i przechowywanie danych mogą działać bez opuszczania środowiska organizacji przez dane klientów.
Całe wdrożenie jest dostarczane jako skonteneryzowane usługi Docker i działa w infrastrukturze zarządzanej przez klienta, wdrożone na Kubernetes za pomocą Rancher lub Helm.
Mihu dostarcza własne modele mowy — Mihu STT (Speech-to-Text) i Mihu TTS (Text-to-Speech) — w pełni on-premise. W obsługiwanych wdrożeniach:
Te 7 języków działa w całości na własnych modelach STT i TTS Mihu, w Państwa infrastrukturze. Platforma chmurowa Mihu obsługuje ponad 40 języków dzięki dodatkowym modelom mowy.
Infrastruktura mowy Mihu została zaprojektowana tak, aby ograniczyć wymagania inferencji. W zależności od języka i konfiguracji modelu wdrażane modele mowy mają około 66M – 143M parametrów.
Dzięki temu obciążenia STT i TTS mogą działać na infrastrukturze CPU bez konieczności przydzielania dedykowanego GPU do każdego obciążenia głosowego.
Wartości równoczesności ustalane są dla każdego wdrożenia na podstawie testów wydajnościowych na docelowym sprzęcie, a nie podawane jako stały stosunek CPU do liczby połączeń.
Własne dane mowy i głosy marki pozostają w infrastrukturze kontrolowanej przez Państwa.
Organizacje dysponujące wysokiej jakości własnymi danymi mowy mogą dodatkowo dostosować warstwę mowy. Mihu może przeprowadzić fine-tuning obsługiwanych modeli STT/TTS bezpośrednio w infrastrukturze kontrolowanej przez klienta, dzięki czemu zastrzeżone zbiory danych nie muszą być przekazywane zewnętrznemu dostawcy inferencji.
Szczególnie przydatne dla organizacji ze specjalistycznym słownictwem, regionalnymi akcentami lub rygorystycznymi wymaganiami dotyczącymi lokalizacji danych.
Mihu On-Premise obsługuje również prywatne klonowanie głosu. Dostarczone próbki głosu mogą posłużyć do utworzenia głosów specyficznych dla organizacji, które następnie są hostowane we własnej infrastrukturze klienta.
Zarówno nagrania źródłowe, jak i powstały model głosu mogą pozostać prywatne.
Pozwala to przedsiębiorstwom tworzyć spójne głosy marki bez korzystania z zewnętrznego dostawcy TTS podczas inferencji produkcyjnej.
Wymaganie dotyczące próbki głosu: około 30 sekund czystej mowy, nagranej bez długich pauz ani przerw między zdaniami.
Lekkie modele mowy dla CPU są przede wszystkim dedykowane poszczególnym językom i nie stanowią jednego modelu wielojęzycznego. Dla agentów AI, którzy muszą dynamicznie zmieniać język w trakcie tej samej interakcji, Mihu obsługuje kilka strategii wdrożenia.
Wiele modeli mowy dedykowanych poszczególnym językom działa jednocześnie. Warstwa orkiestracji Mihu wykrywa lub otrzymuje aktywny język i dynamicznie kieruje przetwarzanie mowy do właściwego modelu.
Wybór modelu w trakcie interakcji może być również sterowany nadpisaniami na poziomie systemu.
W scenariuszach wymagających wysoce dynamicznych rozmów wielojęzycznych można zamiast tego wdrożyć większe wielojęzyczne modele mowy na infrastrukturze GPU.
Architektura jest optymalizowana pod kątem efektywności CPU z modelami dedykowanymi językowo albo maksymalnej elastyczności wielojęzycznej z modelami GPU, w zależności od obciążenia.
Uwaga: wielojęzyczne STT i wielojęzyczne TTS wymagają infrastruktury GPU. Ścieżka mowy wyłącznie na CPU dotyczy modeli Mihu STT i Mihu TTS specyficznych dla języka.
Warstwa rozumowania działa w całości wewnątrz Państwa środowiska na modelach LLM open-weight: modelach, których wagi zostały publicznie udostępnione i które mogą działać całkowicie offline na Państwa własnym sprzęcie, bez połączenia z dostawcą modelu. Mihu na bieżąco ocenia nowe modele open-weight, zamiast trwale wiązać stos on-premise z jedną rodziną modeli.
Wydajne wdrożenia LLM zazwyczaj wymagają infrastruktury GPU. Rekomendowany model może się zmieniać wraz z pojawianiem się nowych modeli, a Mihu może aktualizować lub wymieniać model rozumowania niezależnie od pozostałej części infrastruktury agentów.
Infrastruktura jest niezależna od modelu. Najlepszy dostępny model może się zmienić; Państwa architektura nie musi.
Model wnioskowania jest wybierany w momencie wdrożenia z bieżącego zestawu ewaluacyjnego. Według stanu na wrzesień 2026 jedną z naszych preferowanych wydajnych konfiguracji jest Kimi K2.6 Instant. Działa on na dedykowanej infrastrukturze GPU, udostępnianej dodatkowo ponad bazę 128 vCPU. Tam, gdzie obowiązują wymagania dotyczące zakupu lub pochodzenia modelu, można wybrać alternatywy open-weight od innych dostawców i z innych regionów, takie jak Llama lub Mistral. Wybór jest potwierdzany w każdej propozycji wdrożenia.
Pełne wdrożenie Mihu On-Premise składa się z kilku niezależnych usług. Wszystkie komponenty podstawowe są dostarczane jako skonteneryzowane usługi Docker i wdrażane na Kubernetes za pomocą Rancher lub Helm.
Podstawowe środowisko uruchomieniowe agentów AI i logika biznesowa.
Koordynuje modele mowy, modele LLM, agentów i usługi uruchomieniowe.
Warstwa komunikacji w czasie rzeczywistym pomiędzy usługami a sesjami agentów.
Obsługuje telefonię korporacyjną i łączność SIP.
Obsługuje wychodzące i wysokowolumenowe obciążenia komunikacyjne.
Wykonuje narzędzia, integracje i działania agentów.
Interfejs administracji, konfiguracji i zarządzania operacyjnego.
Trwałe przechowywanie danych aplikacyjnych i operacyjnych.
Stan w czasie rzeczywistym, buforowanie i rozproszona koordynacja środowiska uruchomieniowego.
Dodatkowe funkcje Mihu również mogą zostać wdrożone on-premise. Komponenty te wymagają dodatkowej pojemności serwerowej w zależności od wykorzystania.
Do generowania i uruchamiania własnych usług, kodu, integracji i przepływów pracy. Uruchomienie Buildera wymaga dodatkowej pojemności GPU na serwerze.
Do udostępniania przestrzeni roboczej Mihu i jej funkcji systemom AI zgodnym z MCP.
Łączy istniejącą centralę PBX lub system telefoniczny z infrastrukturą SIP Mihu na potrzeby połączeń przychodzących i wychodzących.
Wymagany, jeśli chcą Państwo podłączyć kanał e-mail. Wiadomości agentów i powiadomienia są wysyłane przez Państwa własny serwer SMTP.
Wdrożenia produkcyjne powinny obejmować dedykowaną infrastrukturę obserwowalności. Mihu zaleca odrębną infrastrukturę do scentralizowanego logowania i monitorowania.
Logi z Mihu Core, warstwy orkiestracji, SIP, relay, serwerów modeli i usług aplikacyjnych są zbierane centralnie.
Metryki infrastruktury i aplikacji są monitorowane w sposób ciągły. Po przekroczeniu zdefiniowanych progów operacyjnych mogą być generowane alerty.
Wszystkie usługi Mihu działają na serwerach we własnej sieci klienta. Do pracy produkcyjnej nie jest wymagany VPN, tunel ani stałe połączenie z Mihu.
Wewnętrzne usługi AI nie wymagają publicznego udostępnienia. Telefonia dociera do infrastruktury SIP przez istniejące połączenie klienta z operatorem lub centralą PBX, a reguły sieciowe są definiowane w całości przez politykę infrastruktury i bezpieczeństwa klienta.
Dla produkcyjnej instalacji Mihu On-Premise początkowa konfiguracja infrastruktury jest ustalana na podstawie oczekiwanej liczby równoczesnych rozmów i obciążeń.
Baza 128 vCPU obejmuje usługi Mihu Core oraz STT/TTS na CPU. Nie obejmuje warstwy wnioskowania: wydajny, samodzielnie hostowany LLM, taki jak Kimi K2.6 Instant, wymaga dedykowanej infrastruktury GPU ponad tę bazę, dobranej do wybranego modelu i oczekiwanej współbieżności. Wybór mniejszego modelu open-weight odpowiednio zmniejsza zapotrzebowanie na GPU. Pojemność GPU jest dodawana także wtedy, gdy wymagane są wielojęzyczne modele mowy na GPU. Dokładna alokacja zależy od liczby równoczesnych rozmów AI, obciążenia STT/TTS, wdrożonych języków, wyboru LLM, konfiguracji redundancji oraz usług dodatkowych, takich jak Builder i MCP.
Podział na rdzenie fizyczne i vCPU jest potwierdzany w propozycji wdrożenia.
Wymagania dotyczące przestrzeni dyskowej zależą przede wszystkim od tego, czy nagrania rozmów i inne materiały są przechowywane lokalnie. Bazy danych aplikacji Mihu wymagają trwałej przestrzeni dyskowej, natomiast pojemność na nagrania jest wyliczana osobno. Klienci przechowujący nagrania przez miesiące lub lata powinni przewidzieć dedykowany wolumen dyskowy o rozmiarze odpowiadającym ich polityce przechowywania.
Architektura produkcyjna może zostać skonfigurowana z redundancją kluczowych usług Mihu. Osiągnięcie tego celu wymaga utrzymania uzgodnionej architektury produkcyjnej, redundancji i wymagań infrastrukturalnych.
Dla korporacyjnych instalacji on-premise przypisywana jest dedykowana odpowiedzialność operacyjna. W przypadku braku awarii infrastruktury bazowej lub sprzętu pozostających poza odpowiedzialnością operacyjną Mihu wdrożenie jest projektowane pod kątem uzgodnionego celu dostępności usługi na poziomie 99.9%. Zakres odpowiedzialności poszczególnych warstw określa dokument SLA.
Pełny stos Mihu jest dostarczany jako wstępnie skonfigurowane usługi Docker. Zespół inżynierów Mihu odpowiada za konfigurację wdrożenia i gotowość produkcyjną wspólnie z zespołem infrastrukturalnym klienta. Typowe wdrożenie on-premise jest realizowane w 3–6 miesięcy, od przygotowania infrastruktury po produkcję, i jest dostępne dla klientów korporacyjnych.
Kubernetes: stos można wdrożyć przy użyciu chartów Helm. Standardową i najszybszą ścieżką Mihu jest wdrożenie Kubernetes zarządzane przez Rancher.
Mihu On-Premise stosuje wersjonowanie oparte na gałęziach: każde wdrożenie klienta działa na własnej gałęzi wydania, a aktualizacje są dostarczane jako wydania miesięczne. Każde wydanie jest walidowane przed wdrożeniem i wdrażane w koordynacji z zespołem infrastruktury klienta, dzięki czemu aktualizacje są planowane, a nie wymuszane. Walidacja wydania obejmuje standardowy zestaw testów; niektóre testy jednostkowe mogą się różnić w zależności od dostosowań specyficznych dla klienta.
Do każdego środowiska on-premise Mihu przydziela zespół customer success oraz zespół DevOps, które pracują wspólnie z Państwa zespołem. Wsparcie prowadzone jest przez wspólną grupę na Slacku, dzięki czemu pytania operacyjne, koordynacja wydań i incydenty są obsługiwane bezpośrednio przez osoby znające Państwa wdrożenie.
Jednostronicowy przegląd tego, co i gdzie działa we wdrożeniu Mihu On-Premise.
Pełny stos: Speech-to-Text, Text-to-Speech, klonowanie głosu, warstwa rozumowania LLM, orkiestracja, telefonia SIP, Action Server do integracji, aplikacja zarządzająca oraz warstwy bazy danych i Redis. Dane klientów nie muszą opuszczać Państwa środowiska.
Nie w warstwie mowy. STT i TTS działają na CPU z modelami o wielkości od około 66M do 143M parametrów. Wydajne modele LLM open-weight zazwyczaj wymagają infrastruktury GPU, a pojemność GPU jest dodawana również w przypadku wyboru większych wielojęzycznych modeli mowy.
Obecny stos mowy on-premise działający na CPU obsługuje siedem języków: angielski, niemiecki, francuski, hiszpański, włoski, rosyjski i turecki. Te modele Mihu STT i Mihu TTS dla poszczególnych języków działają na CPU, bez GPU. Mihu STT osiąga zazwyczaj około 5–9% współczynnika błędów słów (WER); dokładna wartość zależy od języka i zbioru danych ewaluacyjnych.
Warstwa rozumowania jest niezależna od modelu i działa na modelach open-weight. Mihu rekomenduje model na dzień wdrożenia, a w celu spełnienia wymagań dotyczących zakupu lub pochodzenia modelu można wybrać alternatywy od innych dostawców i z innych regionów, na przykład Llama lub Mistral obok Kimi K2.6 Instant. Model można aktualizować lub wymieniać niezależnie od pozostałej części infrastruktury agentów, gdy pojawią się lepsze modele open-weight.
Tak. Obsługiwane modele STT i TTS mogą być dostrajane w infrastrukturze kontrolowanej przez klienta z użyciem Państwa własnych zbiorów danych, dzięki czemu zastrzeżone materiały audio nigdy nie trafiają do zewnętrznego dostawcy. Powstałe modele pozostają prywatne dla Państwa organizacji.
Typowa baza produkcyjna zaczyna się od 128 vCPU dla podstawowych usług Mihu i warstwy mowy na CPU. Samodzielnie hostowany LLM jest wymiarowany osobno i wymaga dedykowanej infrastruktury GPU ponad tę bazę; pojemność GPU jest dodawana także dla wielojęzycznych modeli mowy na GPU. Pamięć masowa jest wymiarowana na podstawie Państwa polityki retencji nagrań i transkrypcji. Dokładne wymiarowanie jest potwierdzane w propozycji wdrożenia.
Wszystko jest dostarczane jako wstępnie skonfigurowane usługi Docker i działa na własnych serwerach klienta. Do pracy produkcyjnej nie jest wymagany VPN ani połączenie zwrotne z Mihu, a żadna wewnętrzna usługa AI nie wymaga publicznego udostępnienia. Zespół inżynierski Mihu zajmuje się konfiguracją wdrożenia wspólnie z Państwa zespołem infrastruktury.
Tak. Nowe języki można dodać na życzenie. Nakład pracy zależy od grupy językowej, a STT i TTS są trenowane osobno. Mihu może dostarczyć lub zakupić zbiór danych treningowych dla Państwa albo pracować na danych przez Państwa dostarczonych. Trening odbywa się na maszynach udostępnionych przez Państwa lub na infrastrukturze zapewnionej przez Mihu, a powstałe modele Mihu STT i Mihu TTS są następnie wdrażane w Państwa środowisku dokładnie tak jak modele standardowe.
Prosimy o przekazanie oczekiwanej liczby równoczesnych rozmów, języków i wymagań dotyczących lokalizacji danych. Nasz zespół inżynierów przedstawi propozycję doboru zasobów i plan wdrożenia.