# פריסת On-Premise — Mihu AI

Mihu AI On-Premise

# הסוכנים שלכם. המודלים שלכם. הקולות שלכם. התשתית שלכם. הנתונים שלכם.

Mihu מפעילה את מערך סוכני ה-AI המלא — מדיבור וחשיבה ועד טלפוניה ופעולות — בתוך התשתית שלכם. נתוני לקוחות אינם חייבים לצאת מהסביבה שלכם.

שיחה עם צוות המכירות (https://mihu.ai/he/contact) דרישות הפריסה (https://mihu.ai/he/on-premise#requirements)

7

שפות דיבור בפריסת On-Premise

CPU

היסק Mihu STT ו-TTS

99.9%

יעד זמינות

גבול הפריסה

בתוך הרשת שלכם

טלפוניה

תשתית SIP, שירותי דיוור המוני

מקומי

דיבור

Mihu STT, Mihu TTS ושכפול קול על CPU

מקומי

חשיבה

מודל LLM בעל משקלים פתוחים, באחסון עצמי

מקומי

פעולות

Action Server, אינטגרציות, תהליכי עבודה

מקומי

נתונים

מסד נתונים, Redis, הקלטות, תמלולים

מקומי

נמסר כשירותי Docker בקונטיינרים על תשתית המנוהלת על ידי הלקוח, ונפרס על Kubernetes באמצעות Rancher או Helm.

סקירה

## תשתית קול פרטית מבוססת AI, הנפרסת כולה בתוך הסביבה שלכם.

Mihu AI On-Premise היא הצעה ארגונית המאפשרת לארגונים להפעיל את מערך סוכני Mihu AI המלא בתוך התשתית שלהם.

עיבוד דיבור, היסק AI, תזמור, טלפוניה, אינטגרציות, שירותי אפליקציה ואחסון נתונים יכולים לפעול מבלי שנתוני הלקוחות יצאו מסביבת הארגון.

הפריסה כולה נמסרת כשירותי Docker בקונטיינרים ופועלת על תשתית המנוהלת על ידי הלקוח, פרוסה על Kubernetes באמצעות Rancher או Helm.

דיבור

On-Premise, היסק על CPU

LLM

משקלים פתוחים, אחסון עצמי

טלפוניה

SIP בתוך הרשת שלכם

נתונים

אחסון בשליטת הלקוח

תשתית דיבור

## Mihu STT ו-Mihu TTS, במלואם on-premise.

Mihu מספקת את מודלי הדיבור שלה — Mihu STT (דיבור לטקסט) ו-Mihu TTS (טקסט לדיבור) — במלואם on-premise. בפריסות נתמכות:

Mihu STT (דיבור לטקסט) פועל מקומית.

Mihu TTS (טקסט לדיבור) פועל מקומית.

עבור שכבת הדיבור נתמך היסק על CPU בלבד.

אין צורך בממשק API חיצוני לדיבור.

שכפול קול ניתן לפריסה בתוך התשתית של הלקוח.

קובצי האודיו ונתוני האימון של הלקוח יכולים להישאר כולם בתוך סביבת הלקוח.

מערך הדיבור הנוכחי ב-On-Premise · 7 שפות

אנגלית גרמנית צרפתית ספרדית איטלקית רוסית טורקית

7 השפות הללו פועלות במלואן על מודלי ה-STT וה-TTS של Mihu עצמה, בתוך התשתית שלכם. פלטפורמת הענן של Mihu תומכת ביותר מ-40 שפות באמצעות מודלי דיבור נוספים.

5–9%

שיעור שגיאות המילים (WER) האופייני בפריסות Mihu STT (דיבור לטקסט) הנוכחיות, בהתאם לשפה ולמערך הנתונים לבחינה.

### מודלי דיבור קלים ל-CPU

תשתית הדיבור של Mihu תוכננה כך שדרישות ההיסק יישארו נמוכות. בהתאם לשפה ולתצורת המודל, מודלי הדיבור הנפרסים מונים כ-66M – 143M פרמטרים.

הדבר מאפשר להפעיל עומסי STT ו-TTS על תשתית CPU בלי להידרש ל-GPU ייעודי עבור כל עומס קולי.

הקיבולת בפועל תלויה ב

מספר השיחות המקבילות

השפה הנבחרת

מודל ה-STT/TTS הנבחר

תצורת האודיו

יעד ההשהיה

דרישות היתירות

נתוני המקביליות נקבעים לכל פריסה באמצעות בחינת ביצועים על החומרה היעודה, ואינם ננקבים כיחס קבוע בין CPU למספר שיחות.

התאמה אישית

## כוונון עדין פרטי ושכפול קול

נתוני דיבור קנייניים וקולות המותג נשארים על תשתית שבשליטתכם.

### כוונון עדין פרטי

ארגונים בעלי נתוני דיבור קנייניים באיכות גבוהה יכולים להתאים את שכבת הדיבור באופן נוסף. Mihu יכולה לבצע כוונון עדין למודלי STT/TTS נתמכים ישירות על תשתית שבשליטת הלקוח, כך שאין צורך להעביר מערכי נתונים קנייניים לספק היסק צד שלישי.

מודלים מותאמים יכולים להיות

מכווננים באמצעות מערכי נתונים שהלקוח מספק

ממוטבים לטרמינולוגיה ענפית

מותאמים למבטאים ולדיבור ייחודי לתחום

נפרסים בלעדית בתוך התשתית של הלקוח

נשמרים פרטיים, במלואם בתוך התשתית שלכם

שימושי במיוחד לארגונים בעלי אוצר מילים מקצועי, מבטאים אזוריים או דרישות מחמירות למקום שמירת הנתונים.

### שכפול קול

Mihu On-Premise תומכת גם בשכפול קול פרטי. דגימות קול שמסופקות יכולות לשמש ליצירת קולות ייחודיים לארגון, המאוחסנים לאחר מכן בתוך התשתית של הלקוח.

הן ההקלטות המקוריות והן מודל הקול המתקבל יכולים להישאר פרטיים.

כך ארגונים יכולים ליצור קולות מותג עקביים מבלי להסתמך על ספק TTS חיצוני במהלך היסק בסביבת הייצור.

דרישת דגימת הקול: כ-30 שניות של דיבור נקי, שהוקלט ללא הפסקות ארוכות או רווחים בין המשפטים.

ארכיטקטורה רב-לשונית

## מודלים ייעודיים לשפה על CPU, או מודלים רב-לשוניים על GPU

מודלי הדיבור הקלים ל-CPU הם בעיקרם ייעודיים לשפה ולא מודל רב-לשוני יחיד. עבור סוכני AI הנדרשים להחליף שפות באופן דינמי במהלך אותה אינטראקציה, Mihu תומכת בכמה אסטרטגיות פריסה.

יעילות CPU

### תזמור מודלים

כמה מודלי דיבור ייעודיים לשפה פועלים במקביל. שכבת התזמור של Mihu מזהה או מקבלת את השפה הפעילה ומנתבת את עיבוד הדיבור באופן דינמי למודל המתאים.

עקיפות ברמת המערכת יכולות אף הן לשלוט בבחירת המודל במהלך אינטראקציה.

גמישות רב-לשונית מרבית

### מודלים רב-לשוניים על GPU

לתרחישים המחייבים שיחות רב-לשוניות דינמיות במיוחד, ניתן לפרוס במקום זאת מודלי דיבור רב-לשוניים גדולים יותר על תשתית GPU.

הארכיטקטורה ממוטבת ליעילות CPU עם מודלים ייעודיים לשפה, או לגמישות רב-לשונית מרבית עם מודלים מבוססי GPU, בהתאם לעומס העבודה.

הערה: STT רב-לשוני ו-TTS רב-לשוני דורשים שניהם תשתית GPU. מסלול הדיבור על CPU בלבד חל על מודלי Mihu STT ו-Mihu TTS הייעודיים לכל שפה.

תשתית LLM מקומית

## שכבת החשיבה פועלת על מודלים בעלי משקלים פתוחים בתוך הסביבה שלכם.

שכבת החשיבה פועלת כולה בתוך הסביבה שלכם באמצעות מודלי LLM בעלי משקלים פתוחים: מודלים שהמשקלים שלהם מפורסמים בפומבי ויכולים לפעול במנותק מהרשת על החומרה שלכם, ללא כל חיבור לספק המודל. Mihu בוחנת באופן שוטף מודלים חדשים בעלי משקלים פתוחים, במקום לקשור את מערך ה-On-Premise לצמיתות למשפחת מודלים אחת.

פריסות LLM בעלות ביצועים גבוהים מחייבות בדרך כלל תשתית GPU. המודל המומלץ עשוי להשתנות ככל שמודלים חדשים הופכים לזמינים, ו-Mihu יכולה לעדכן או להחליף את מודל החשיבה בנפרד משאר תשתית הסוכנים.

התשתית אינה תלויה במודל מסוים. המודל הטוב ביותר הזמין עשוי להשתנות; הארכיטקטורה שלכם אינה חייבת להשתנות.

התצורה המומלצת נכון למועד הפריסה

מודל ההסקה נבחר בזמן הפריסה מתוך מערך ההערכה הנוכחי. נכון לספטמבר 2026, אחת התצורות בעלות הביצועים הגבוהים המועדפות עלינו היא Kimi K2.6 Instant. הוא פועל על תשתית GPU ייעודית המוקצית בנוסף לבסיס של 128 vCPU. ניתן לבחור חלופות בעלות משקלים פתוחים מספקים ומאזורים אחרים, כגון Llama או Mistral, במקומות שבהם חלות דרישות רכש או דרישות למקור המודל. הבחירה מאושרת בכל הצעת פריסה.

תשתית Mihu Core

## ממה מורכבת פריסה מלאה

פריסת Mihu On-Premise מלאה מורכבת מכמה שירותים עצמאיים. כל רכיבי הליבה נמסרים כשירותי Docker בקונטיינרים ונפרסים על Kubernetes באמצעות Rancher או Helm.

01

### Mihu Core

סביבת הריצה המרכזית של סוכני ה-AI ולוגיקת העסק.

02

### Mihu Orchestration

מתאם בין מודלי דיבור, מודלי LLM, סוכנים ושירותי ריצה.

03

### Mihu Relay

שכבת תקשורת בזמן אמת בין השירותים לבין מושבי הסוכנים.

04

### תשתית SIP

מטפלת בטלפוניה ארגונית ובקישוריות SIP.

05

### שירותי דיוור המוני

תומכים בעומסי תקשורת יוצאת ובנפחים גבוהים.

06

### Action Server

מריץ כלים, אינטגרציות ופעולות של סוכנים.

07

### אפליקציית ניהול / ווב

ממשק לניהול, להגדרות ולתפעול.

08

### תשתית מסד נתונים

אחסון מתמיד של נתוני אפליקציה ונתונים תפעוליים.

09

### תשתית Redis

מצב בזמן אמת, מטמון ותיאום ריצה מבוזר.

### תשתית אופציונלית

גם יכולות Mihu נוספות ניתנות לפריסה On-Premise. רכיבים אלה דורשים קיבולת שרתים נוספת בהתאם לשימוש.

### Mihu Builder

ליצירה והרצה של שירותים, קוד, אינטגרציות ותהליכי עבודה מותאמים אישית. הרצת Builder דורשת קיבולת GPU נוספת על השרת.

### Mihu MCP Server

לחשיפת סביבת העבודה והיכולות של Mihu למערכות AI התומכות ב-MCP.

### PBX Connector Server

מחבר את מרכזיית ה-PBX או מערכת הטלפוניה הקיימת שלכם לתשתית ה-SIP של Mihu עבור שיחות נכנסות ויוצאות.

### שרת SMTP

נדרש אם ברצונכם לחבר את ערוץ הדוא"ל. הודעות הדוא"ל של הסוכנים וההתראות נשלחות דרך שרת ה-SMTP שלכם.

ניטור ורישום

## ניטור ייעודי לפריסות ייצור

פריסות ייצור צריכות לכלול תשתית ניטור ייעודית. Mihu ממליצה על תשתית נפרדת לרישום ולניטור מרוכזים.

### רישום מרוכז

יומני Mihu Core, שכבת התזמור, SIP, Relay, שרתי המודלים ושירותי האפליקציה נאספים באופן מרוכז.

### ניטור

מדדי התשתית והאפליקציה מנוטרים ברציפות. ניתן להפיק התראות בעת חריגה מספי תפעול שנקבעו מראש.

מדדים מנוטרים

ניצולת CPU

ניצולת זיכרון

ניצולת GPU

קיבולת דיסק

תקינות הרשת

תקינות השירותים

השהיית היסק של מודלים

עומק התור

תשתית השיחות

שגיאות אפליקציה

ארכיטקטורת רשת

## לא נדרשת קישוריות חיצונית

כל שירותי Mihu פועלים על שרתים בתוך הרשת של הלקוח עצמו. להפעלה בייצור לא נדרשים VPN, מנהרה או חיבור קבוע ל-Mihu.

שירותי ה-AI הפנימיים אינם צריכים חשיפה ציבורית. הטלפוניה מגיעה לתשתית ה-SIP דרך חיבור הספק או מרכזיית ה-PBX הקיימים של הלקוח, וכללי הרשת מוגדרים במלואם על ידי מדיניות התשתית והאבטחה של הלקוח.

רשת הלקוח

נקודות כניסה SIP trunk / PBX אפליקציית ווב API

Core / Orchestration / SIP

STT LLM TTS פעולות

DB / מטמון / אחסון

תפעול לוגים התראות ניטור

דרישות תשתית

## בסיס לסביבת ייצור

עבור התקנת ייצור של Mihu On-Premise, תצורת התשתית ההתחלתית נקבעת בהתאם למקביליות ולעומסי העבודה הצפויים.

### מחשוב

128 vCPU

מינימום מומלץ · שירותי ליבה ושכבת דיבור על CPU

+ GPU

בהתאם למודל שנבחר · לדוגמה Kimi K2.6 Instant, Qwen, Llama או Mistral; המודל המומלץ עשוי להשתנות עם הזמן

הבסיס של 128 vCPU מכסה את שירותי Mihu Core ואת STT/TTS על CPU. הוא אינו מכסה את שכבת ההסקה: LLM מתארח עצמאית בעל ביצועים גבוהים כגון Kimi K2.6 Instant דורש תשתית GPU ייעודית בנוסף לבסיס זה, בגודל המותאם למודל שנבחר ולמקביליות הצפויה. בחירה במודל קטן יותר בעל משקלים פתוחים מפחיתה בהתאם את הצורך ב-GPU. קיבולת GPU מתווספת גם כאשר נדרשים מודלי דיבור רב-לשוניים על GPU. ההקצאה המדויקת תלויה בשיחות AI מקבילות, בעומס STT/TTS, בשפות שנפרסו, בבחירת ה-LLM, בתצורת היתירות ובשירותים נוספים כגון Builder ו-MCP.

החלוקה בין ליבות פיזיות ל-vCPU מאושרת בהצעת הפריסה.

### אחסון

שיחות × משך ממוצע × פורמט הקלטה × תקופת שמירה

קיבולת הקלטות

דרישות האחסון תלויות בעיקר בשאלה אם הקלטות שיחות ומדיה אחרת נשמרות מקומית. מסדי הנתונים של אפליקציות Mihu מחייבים אחסון מתמיד, ואילו קיבולת ההקלטות מחושבת בנפרד. לקוחות השומרים הקלטות למשך חודשים או שנים צריכים להקצות אמצעי אחסון ייעודי שגודלו נגזר ממדיניות השמירה שלהם.

הלקוחות מגדירים בעצמם

שמירת הקלטות

שמירת תמלולים

מדיניות גיבוי

מדיניות ארכוב

מדיניות מחיקה

### זמינות גבוהה

99.9%

יעד זמינות תפעולית

ניתן להגדיר את ארכיטקטורת הייצור עם יתירות בשירותי Mihu הקריטיים. עמידה ביעד זה מחייבת שמירה על ארכיטקטורת הייצור המוסכמת, על היתירות ועל דרישות התשתית.

להתקנות On-Premise ארגוניות מוקצית אחריות תפעולית ייעודית. בהיעדר תקלות בתשתית או בחומרה שבבסיס המערכת שאינן באחריותה התפעולית של Mihu, הפריסה מתוכננת לעמוד ביעד זמינות השירות המוסכם של 99.9%. חלוקת האחריות לפי שכבות מוגדרת במסמך ה-SLA.

פריסה

## מוגדר מראש, ב-Docker, ומיושם יחד עם צוות התשתיות שלכם

מערך Mihu המלא מסופק כשירותי Docker מוגדרים מראש. צוות ההנדסה של Mihu אחראי על תצורת הפריסה ועל המוכנות לייצור, יחד עם צוות התשתיות של הלקוח. פריסת on-premise טיפוסית מסופקת בתוך 3–6 חודשים, מהכנת התשתית ועד לייצור, והיא זמינה ללקוחות ארגוניים.

הכנת התשתית

הגדרת הרשת

שירותי Mihu

מודלי דיבור

LLM

טלפוניה

אחסון

ניטור

אימות

ייצור

Kubernetes: ניתן לפרוס את המערך באמצעות תרשימי Helm. המסלול הסטנדרטי והמהיר ביותר של Mihu הוא פריסת Kubernetes המנוהלת באמצעות Rancher.

### ניהול גרסאות ושחרורים

Mihu On-Premise משתמש בניהול גרסאות מבוסס ענפים: כל פריסת לקוח פועלת על ענף שחרור משלה, והעדכונים נמסרים כשחרורים חודשיים. כל שחרור מאומת לפני ההפצה ומיושם בתיאום עם צוות התשתיות של הלקוח, כך שהשדרוגים מתוכננים ולא נכפים. אימות השחרור כולל את מערך הבדיקות הסטנדרטי; חלק מבדיקות היחידה עשויות להשתנות בהתאם להתאמות הייחודיות ללקוח.

### צוות תמיכה ייעודי

לכל סביבת on-premise מקצה Mihu צוות Customer Success וצוות DevOps שיעבדו לצד הצוות שלכם. התמיכה מתנהלת דרך קבוצת Slack משותפת, כך ששאלות תפעוליות, תיאום שחרורים ותקלות מטופלים ישירות מול האנשים שמכירים את הפריסה שלכם.

## הכול נשאר בפנים.

מבט בעמוד אחד על מה פועל והיכן בפריסת Mihu On-Premise.

דיבור On-Premise

Mihu STT CPU

Mihu TTS CPU

שכפול קול פרטי

LLM משקלים פתוחים / אחסון עצמי

כוונון עדין על תשתית הלקוח

טלפוניה SIP

נתונים בשליטת הלקוח

הקלטות בשליטת הלקוח

מסד נתונים On-Premise

אינטגרציות Action Server ב-On-Premise

פריסה ב-Docker · Kubernetes (Rancher / Helm)

קישוריות בתוך רשת הלקוח

ניטור ייעודי

יעד SLA 99.9%

אספקה 3–6 חודשים עד לייצור

זמינות לקוחות ארגוניים

תמיכה צוות Customer Success + צוות DevOps, קבוצת Slack משותפת

שחרורים חודשיים, ניהול גרסאות מבוסס ענפים

שאלות נפוצות

## Mihu AI On-Premise — שאלות נפוצות

מה בעצם פועל בתוך התשתית שלנו?

המערך המלא: המרת דיבור לטקסט, המרת טקסט לדיבור, שכפול קול, שכבת החשיבה מבוססת ה-LLM, התזמור, טלפוניית SIP, ה-Action Server לאינטגרציות, אפליקציית הניהול ושכבות מסד הנתונים ו-Redis. נתוני לקוחות אינם חייבים לצאת מהסביבה שלכם.

האם אנחנו זקוקים ל-GPU?

לא עבור שכבת הדיבור. STT ו-TTS פועלים על CPU עם מודלים המונים כ-66M עד 143M פרמטרים. מודלי LLM עתירי ביצועים בעלי משקלים פתוחים מחייבים בדרך כלל תשתית GPU, וקיבולת GPU נוספת גם אם תבחרו במודלי דיבור רב-לשוניים גדולים יותר.

אילו שפות נתמכות במערך הדיבור של On-Premise?

מערך הדיבור on-premise הנוכחי, הפועל על CPU, תומך בשבע שפות: אנגלית, גרמנית, צרפתית, ספרדית, איטלקית, רוסית וטורקית. מודלי Mihu STT ו-Mihu TTS הייעודיים לכל שפה פועלים על CPU, ללא GPU. Mihu STT משיג בדרך כלל שיעור שגיאות מילים (WER) של כ-5–9%; הערך המדויק תלוי בשפה ובמערך נתוני ההערכה.

באיזה מודל LLM נעשה שימוש, והאם ניתן להחליף אותו בהמשך?

שכבת החשיבה אינה תלויה במודל מסוים ומריצה מודלים בעלי משקלים פתוחים. Mihu ממליצה על מודל נכון למועד הפריסה, וניתן לבחור חלופות מספקים ומאזורים שונים, למשל Llama או Mistral לצד Kimi K2.6 Instant, כדי לעמוד בדרישות רכש או בדרישות למקור המודל. את המודל אפשר לעדכן או להחליף בנפרד משאר תשתית הסוכנים ככל שיהיו זמינים מודלים טובים יותר בעלי משקלים פתוחים.

האם נוכל לבצע כוונון עדין למודלי הדיבור על הנתונים שלנו?

כן. ניתן לבצע כוונון עדין למודלי STT ו-TTS נתמכים על תשתית שבשליטת הלקוח באמצעות מערכי הנתונים שלכם, כך שאודיו קנייני לעולם אינו מגיע לספק צד שלישי. המודלים המתקבלים נשארים פרטיים לארגון שלכם.

איזו תשתית נדרשת לנו כדי להתחיל?

בסיס ייצור טיפוסי מתחיל ב-128 vCPU עבור שירותי הליבה של Mihu ושכבת הדיבור על CPU. ה-LLM המתארח עצמאית מתוכנן בנפרד ודורש תשתית GPU ייעודית בנוסף לבסיס זה; קיבולת GPU מתווספת גם עבור מודלי דיבור רב-לשוניים על GPU. האחסון מתוכנן לפי מדיניות שמירת ההקלטות והתמלולים שלכם. הגודל המדויק מאושר בהצעת הפריסה.

כיצד הפריסה מסופקת ומחוברת?

הכול נמסר כשירותי Docker מוגדרים מראש ופועל על השרתים של הלקוח עצמו. להפעלה בייצור לא נדרש VPN או חיבור חוזר ל-Mihu, ואף שירות AI פנימי אינו זקוק לחשיפה ציבורית. צוות ההנדסה של Mihu מטפל בתצורת הפריסה יחד עם צוות התשתיות שלכם.

האם תוכלו לאמן STT ו-TTS לשפה שאינה בין שבע השפות הנוכחיות?

כן. ניתן להוסיף שפות חדשות לפי בקשה. מאמץ האימון משתנה לפי קבוצת השפה, ו-STT ו-TTS מאומנים בנפרד. Mihu יכולה לספק או לרכוש עבורכם את מערך נתוני האימון, או לעבוד עם נתונים שאתם מספקים. האימון מתבצע על מכונות שאתם מספקים או על תשתית ש-Mihu מספקת, ומודלי Mihu STT ו-Mihu TTS שנוצרים נפרסים לאחר מכן בתוך הסביבה שלכם בדיוק כמו המודלים הסטנדרטיים.

## מתכננים פריסת On-Premise?

שתפו אותנו במקביליות הצפויה, בשפות ובדרישות למקום שמירת הנתונים. צוות ההנדסה שלנו יחזור אליכם עם הצעת מידות והתאמת תשתית ותוכנית פריסה.

שיחה עם צוות המכירות (https://mihu.ai/he/contact)
