סבתא מרוקאית מ-Gemini: מה למדתי מהמודל החדש של גוגל לקול בעברית - Guides_×

Gemini

סבתא מרוקאית מ-Gemini: מה למדתי מהמודל החדש של גוגל לקול בעברית

ערב אחד עם Gemini 3.8 Flash TTS: עיצבתי סבתא מרוקאית בת 85 ונכדה שמזייפת "יום הולדת שמח". מה עבד, מה נחסם, מה עלה (אפס שקלים), ותיאורי קול להעתקה.

Evyatar Yizhak5 דקות קריאה

גוגל הוציאה מודל קול חדש, Gemini 3.8 Flash TTS, שמעצב קולות מתיאור במילים. רציתי לבדוק אותו על הסצנה הכי ישראלית שיכולתי לחשוב עליה: ילדה שרה לסבתא "יום הולדת שמח", מזייפת, הקול נשבר, וסבתא מרוקאית קוטעת אותה: "כפרה עליק בינתי, איזה קול של זמיר יש לך, אני רושמת אותך לכוכב הבא, רק תפסיקי לשיר".

איור פיקסל ארט שנוצר ב-AI: סבתא במטפחת יושבת בכורסה וצוחקת עם ידיים מורמות, לידה ילדה קטנה על שרפרף שרה לתוך מיקרופון וינטג', ועוגת יום הולדת עם נרות על שולחן נמוך ביניהן

ניסיון ראשון: נשמע כמו הקראה

בניסיון הראשון כתבתי לכל דמות פסקת תיאור ארוכה, ולסבתא נתתי את כל הטקסט שלה בבת אחת. העברית יצאה מדויקת מילה במילה (בדקתי בתמלול), אבל התוצאה הייתה מאכזבת:

ניסיון 1: תיאור ארוך, פסקה אחת לסבתא

הסבתא נשמעת צעירה מדי, והכול באותו טון.

שתי בעיות: הסבתא לא נשמעה בת 80, והמבטא לא היה כבד מספיק. וגם הכול יצא מונוטוני: כשמודל מקבל פסקה שלמה, הוא בוחר טון אחד ונשאר בו.

מה שינה את התוצאה

1. תיאור קול קצר, דמות אחת

המדריך הרשמי של גוגל ממליץ על תיאור של משפט או שניים: גיל, מגדר, גוון, טקסטורה ומבטא. זרקתי את הפסקה, כתבתי שלוש סבתות חלופיות, בנות 85, ושמעתי כל אחת. זו שבחרתי המציאה לעצמה פתיחה: "קזבלנקה, יא חביבי".

סבתא מקזבלנקה: דוגמת האודישן שהמודל יצר

את הטקסט הזה המודל כתב לבד, מתוך התיאור.

תיאור הקול של הסבתא (להעתקה)
An elderly 85-year-old woman who came from Casablanca in the 1950s, speaking Hebrew with a thick Moroccan Arabic accent and melody. Deep, cracked, gravelly old-lady voice with a tremor and wheezy breath, loud, expressive and theatrical.

והטריק החשוב: גיל ומבטא נכנסים לתיאור הקול, לא להוראות המשחק. הם תכונות קבועות של הדמות. כל מה שמשתנה בין משפט למשפט (שמחה, קטיעה, עייפות) נכנס בנפרד, בשדה שנקרא style.

2. לפרק את הטקסט לחתיכות

איור פיקסל ארט שנוצר ב-AI: מספריים גדולים גוזרים דף תסריט לחמש רצועות נייר, וכל רצועה עפה אל מיקרופון וינטג' משלה בשורה

במקום פסקה אחת, כל משפט הוא קריאה נפרדת עם הוראת משחק משלו. הילדה קיבלה שלוש: שרה בגאווה, שרה חזק יותר ומזייפת, מנסה להגיע לתו גבוה והקול נשבר. הסבתא קיבלה חמש. אחר כך מדביקים, וסבתא נכנסת רגע לפני שהילדה מסיימת, כמו שקוטעים באמת.

ציר זמן של הדיאלוג: שלוש קריאות לילדה (גאה, מזייפת יותר, הקול נשבר), ואחריהן חמש קריאות לסבתא (נדהמת, נמסה, שבחים מוגזמים, גאה, יבש ועייף). סבתא נכנסת 0.35 שניות לפני שהילדה מסיימת. סך הכול 30.2 שניות
זה לא איור, זו המדידה: כל בלוק הוא קריאה אחת ואורכו האמיתי.
ניסיון 2: שמונה קריאות, הוראת משחק לכל אחת

הילדה נשברת בסוף, הסבתא עולה ויורדת. (זו עוד לא הסבתא שבחרתי, אלא מועמדת 1.)

דוגמה למשפט עם הוראת משחק ותגית
text:  "איזה קול... של זמיר יש לך! <chuckle>"
style: "over-the-top fake praise, drawn out"

התגיות בתוך הטקסט הן רגעים קצרים שהמודל משחק ולא מקריא: <laugh>, <chuckle>, <sigh>, <gasp>, <short pause>. שלוש נקודות הן עצירה.

מה נשבר, ומה כל שבירה לימדה

גוגל חוסמת קולות של ילדים

איור פיקסל ארט שנוצר ב-AI: מיקרופון וינטג' מאחורי מגן כחול זוהר, ורובוט קטן בצד השני מחזיק כרטיס שנעצר במגן, עם משולש אזהרה צהוב מעל

ניסיתי שבעה ניסוחים לקול של הילדה: עם גיל, בלי גיל, "דמות מצוירת", "קול של תוכנית ילדים". כולם נחסמו, עם אותה הודעה:

ההודעה שחזרה שבע פעמים
Voice prompt was blocked by safety policies.

גם בספריית הקולות של גוגל אין אף קול של ילד. מה שעבד: לתאר מבוגרת שעושה קול של ילדה. שחקנית דיבוב בת 20 עם קול קרטון גבוה. זה הגיוני: דיבוב ילדים בטלוויזיה נעשה כמעט תמיד על ידי מבוגרים.

תיאור הקול של "הילדה" (להעתקה)
A 20-year-old Israeli voice actress speaking native Hebrew who performs a very high, squeaky, cartoon-character voice - bright, bouncy and enthusiastic, cracking on high notes.
שחקנית הדיבוב: דוגמת האודישן

המודל המציא לה מונולוג של הכנות למסיבת הפתעה.

האתר של גוגל נכשל, ה-API עבד

ב-Google AI Studio יש כפתור Create new voice, ואז Voice Design. אצלי הוא נכשל שוב ושוב עם The caller does not have permission, גם אחרי החלפת מפתח. אותו מודל, דרך ה-API, עבד בניסיון הראשון. אם זה קורה לכם, לא צריך לדבג: תנו לקלוד לעשות את זה.

פרומפט לקלוד (Claude Code) שעושה את כל העבודה
יש לי מפתח Gemini API בקובץ [נתיב]. תעצב לי קול חדש ב-Gemini 3.8 Flash TTS דרך POST /v1beta/voices (type: prompted, language_code: he-IL) לפי התיאור הזה: [תיאור באנגלית, משפט-שניים]. אחר כך תרנדר את התסריט המצורף משפט אחרי משפט דרך /v1beta/interactions, כל משפט עם style משלו, תדביק לקובץ אחד ותנרמל ל-16- LUFS. תאמת בתמלול Whisper שהעברית יצאה נכון.

מסלול חינם: 10 בקשות ליום

המפתח שהשתמשתי בו התברר כמסלול החינמי: 3 בקשות לדקה ו-10 ליום. זה מספיק לשני קולות ולסבב אחד של דיאלוג, לא יותר. בסבב השני נעצרתי באמצע.

חינםבתשלום
מחיר09$ למיליון טוקני שמע (עד סוף 2026)
דיאלוג של 30 שניות0כ-750 טוקנים, 2-3 אגורות
מגבלה10 בקשות ליוםלפי המכסה של הפרויקט

מה עוד לא פתרתי

"כפרה עליק". המודל מתעקש להגיד "עלייך", בעברית תקנית. ניסיתי ניקוד, והוא לא עזר. בסבב הבא אני בודק שלוש כתיבות: באותיות לטיניות (Kapara alik, ya binti), בעברית עם כ' סופית דגושה, ובאותיות ערביות בתוך המשפט. המדריך יתעדכן עם מה שעבד.

והמבטא: הוא טוב, לא מושלם. מבטא כבד הוא הדבר הכי קשה לקול סינתטי, כי המודל נמשך כל הזמן לעברית "נקייה".

איפה הייתי מתחיל היום

  1. כותבים את הדמות במשפט-שניים באנגלית: גיל, מגדר, גוון, מבטא. בלי פסקאות.
  2. מבקשים שלוש גרסאות לאותו תיאור ובוחרים באוזן. זה זול, וההבדלים גדולים.
  3. מפרקים את התסריט למשפטים, ולכל משפט נותנים הוראת משחק אחת קצרה.
  4. מוסיפים 1-2 תגיות כמו <laugh> או <sigh>, לא יותר.
  5. צריכים ילד? מתארים שחקן או שחקנית דיבוב מבוגרים שעושים קול של ילד.
  6. בודקים בתמלול שהעברית יצאה נכון, ואז מקשיבים שוב, כי תמלול לא שומע מבטא.
מודל קול לא צריך פסקה על הדמות. הוא צריך במאי שעומד ליד כל משפט.

FAQ

האם Gemini TTS מדבר עברית?

כן. Gemini 3.8 Flash TTS תומך ב-130 שפות, כולל עברית (language_code: he-IL). בספריית הקולות של גוגל אין קולות עבריים מוכנים, ולכן בעברית מעצבים קול חדש מתיאור במילים (Voice Design).

אפשר ליצור ב-Gemini קול של ילד?

לא ישירות. כל תיאור של קול ילד נחסם עם ההודעה Voice prompt was blocked by safety policies, וגם בספרייה אין קולות ילדים. מה שעובד הוא לתאר מבוגר או מבוגרת, למשל שחקנית דיבוב בת 20, שעושים קול גבוה של דמות מצוירת.

כמה עולה Gemini 3.8 Flash TTS?

יש מסלול חינמי עם 10 בקשות ליום ו-3 לדקה. בתשלום: 9 דולר למיליון טוקני שמע ו-0.50 דולר למיליון טוקני טקסט עד סוף 2026, כשכל שנייה של שמע היא 25 טוקנים. דיאלוג של 30 שניות עולה פחות מסנט.

איך גורמים לקול AI להישמע פחות מונוטוני?

מפרקים את הטקסט למשפטים ומרנדרים כל משפט בנפרד, עם הוראת משחק קצרה משלו (למשל: laughing, deadpan, proud) ותגית אחת או שתיים כמו <laugh> או <sigh>. כשהמודל מקבל פסקה שלמה, הוא בוחר טון אחד ונשאר בו.

Got a question about any of this, or want to learn to do it yourself?

All the guides