ElevenLabs
איך אני גורם ל-AI לדבר עברית כמו ישראלי
קול מוכן מול קול שעיצבתי ב-ElevenLabs, על אותו טקסט בדיוק. שלושה צעדים, פרומפטים להעתקה, ותגיות רגש שהופכות הקראה להגשה. תשמעו את ההבדל בעצמכם.
זה קורה גם עם המודלים הכי טובים: בוחרים קול שנשמע נהדר באנגלית, מדביקים טקסט בעברית, ומקבלים אמריקאי שמקריא מהדף. במקום להסביר, תקשיבו:

תקשיבו לסופי המשפטים ולמנגינה.
אותו טקסט, אותו מודל. שיניתי דבר אחד: התחלתי מהדמות.
שתי הגרסאות רצו על אותו מודל, Eleven v3, ונורמלו לאותה עוצמה כדי שההשוואה תהיה הוגנת. ההבדל היחיד הוא שאת הקול השני בניתי קודם כדמות: native Israeli Hebrew speaker.
למה קול מוכן נופל בעברית
Voice Design מעצב את זהות הקול: גיל, גוון, מבטא, קצב ואופי. Text to Speech רק מפיק את השמע. קול שנבנה לאנגלית יהגה נכון את רוב המילים וישאיר תחושה של מבטא זר, ולכן מתחילים מהדמות, לא מהטקסט.
בדקתי את הכלים המרכזיים (ההשוואה המלאה בסוף), וההמלצה שלי לרוב היוצרים היא ElevenLabs: לא כי הוא מנצח בכל מדד, אלא כי Voice Design, ספריית קולות, עברית ו-API יושבים אצלו במקום אחד.
שלושה צעדים, זה הכול
מתארים דמות, לא רשימת אפקטים
ב-ElevenLabs: Voices, ואז My Voices, ואז Add a new voice, ואז Voice Design. כותבים באנגלית תיאור של בן אדם שמתחיל ב-native Israeli Hebrew speaker: בן כמה, למי הוא מדבר, כמה קרוב למיקרופון. מקבלים שלוש וריאציות, בוחרים אחת ושומרים.
בודקים על עברית אמיתית
משפט יומיומי, שעה, מספרים, שם מקום ושאלה. אם הקול שורד את טקסט הבדיקה שלמטה, הוא ישרוד גם את הסרטון שלכם.
מוסיפים 2-3 תגיות רגש
בתוך הטקסט עצמו, בסוגריים מרובעים, רגע לפני שההגשה צריכה להשתנות. על זה בהמשך.
רגע, תקשיבו לזה. היום ניצור קריינות בעברית ונבדוק איך היא נשמעת בתוך סרטון אמיתי. ביום שלישי, בשעה שמונה וחצי, ניפגש בתל אביב. יש לנו שלוש דוגמאות, שתי שאלות, והפתעה אחת בסוף. עכשיו תגידו לי: הייתם ממשיכים להקשיב?הפרומפט להעתקה
Native Israeli Hebrew speaker. A male narrator aged 28 to 35, with a warm mid-range voice and a light natural texture. He sounds curious, approachable and confident, explaining a useful discovery to a friend. Fluent contemporary Israeli Hebrew pronunciation and everyday Israeli intonation. Conversational pace, clear consonants, subtle expressive emphasis and relaxed sentence endings. Clean studio recording.רוצים קול אחר? משנים רק את הדמות (גיל, מגדר, אופי) ומשאירים את השלד. אם משהו לא עובד, משנים משתנה אחד בלבד בכל סיבוב, אחרת אי אפשר לדעת מה שיפר את התוצאה.
תגיות רגש: הוראות משחק בתוך הטקסט

ב-Eleven v3 כותבים בתוך הטקסט תגיות כמו [curious], [whispers], [excited], [laughs], [sighs], והמודל משחק אותן במקום להקריא. שלושה כללים מהתיעוד הרשמי ומהניסויים שלי:
- התגית באה רגע לפני השינוי, והיא צריכה להתאים לדמות: לחשן לא ישכנע ב-
[shouts]. אם כל משפט[excited], שום דבר לא מרגש. - Stability קובע כמה המודל מציית: מצב Creative או Natural נותן לתגיות לעבוד; Robust עקבי אבל מגיב פחות.
- פיסוק הוא חלק מהביצוע: שלוש נקודות = עצירה, סימן קריאה = אנרגיה.
[curious] רגע, תקשיבו לזה. [whispers] יש פה טריק קטן שרוב האנשים מפספסים. [surprised] אותו טקסט בדיוק יכול להישמע כמו שני אנשים שונים לגמרי. [laughs softly] ביום שלישי, בשעה שמונה וחצי, ניפגש בתל אביב. [serious] יש לנו שלוש דוגמאות, שתי שאלות, והפתעה אחת בסוף. [excited] עכשיו תגידו לי - הייתם ממשיכים להקשיב?בשביל ההדגמה עיצבתי קול מכוון: בריטון ישראלי מחוספס, מעט צרוד, עם הוראה מפורשת מה הוא לא (לא קריין פרסומות, לא פודקאסטר אמריקאי). ככה הוא נשמע עם התגיות:
דמות + הוראות משחק. זו הרמה שאני מכניס לסרטונים.
Native Israeli Hebrew speaker. A distinctive Israeli male narrator, age 32 to 42, with a low-mid baritone, chest resonance and a naturally rough, lightly gravelly sandpaper texture. He sounds like a sharp, warm person from Tel Aviv who has spent years talking into microphones: streetwise, curious, intimate and confident. Unmistakable contemporary Israeli Hebrew rhythm and pronunciation, with relaxed local sentence endings. Do not sound like a generic commercial announcer, American podcaster or polished audiobook narrator. Keep the rasp subtle and believable, never cartoonish. Able to shift from a conspiratorial whisper to surprise and dry humor while staying clear. Close-miked documentary and podcast recording, human imperfections welcome.בונוס: הסבתא העיראקית בגרסה דרמטית
התגיות הן לא רשימה סגורה; אפשר לכתוב הוראות בימוי חופשיות כמו [dramatic pause] או [leans closer, conspiratorial]. עיצבתי אישה מבוגרת ממוצא עיראקי, עם הוראה לא להגזים במבטא (מבטא הוא חומר סיפורי, לא בדיחה), הורדתי Stability ל-0.28 ונתתי לה תסריט תיאטרלי:
המודל מציית להוראות הבימוי הרבה יותר, ומוותר על קצת עקביות בתמורה.
Native Israeli Hebrew speaker. An Iraqi-Israeli woman in her seventies with a warm, mature, slightly textured voice. She sounds wise, affectionate and observant, as if telling a personal story to someone in the family. Fluent contemporary Israeli Hebrew, with only a very subtle trace of her family background in the musicality of her speech. Do not exaggerate the accent, do not caricature it, and do not use comic delivery. Patient conversational pace, clear diction, natural breaths, gentle emotional emphasis and an intimate close-miked recording.עוד כלים שכדאי להכיר
| כלי | מה הוא עושה טוב | מה צריך לדעת |
|---|---|---|
| OpenAI | הוראות סגנון ב-API פשוט | הקולות מכוונים בעיקר לאנגלית |
| Gemini | מ-3.8: Voice Design בעברית, הוראת משחק לכל משפט | קולות ילדים חסומים. הניסוי שלי עם סבתא מרוקאית |
| MiniMax | Voice Design מהיר דרך API | קול חדש נמחק אם לא מריצים איתו TTS תוך 7 ימים |
| Deepdub | עברית עמוקה: ניקוד, רגש, דיבוב, real-time | מוצר מקצועי/ארגוני; מפרסמים הובלה ב-Hebrew TTS Arena (הטענה שלהם) |
הצ'ק-ליסט שלי לפני שקריינות נכנסת לסרטון
- העברית נשמעת ישראלית לכל האורך, כולל סופי משפטים?
- שמות, מספרים ומילים באנגלית נהגים כמו שהתכוונתי?
- הנשימות וההדגשות מרגישות אנושיות, בלי דרמה מיותרת?
- הייתי ממשיך להקשיב עוד שלושים שניות?
והדבר האחד לזכור, אם זוכרים רק אחד: קריינות טובה בעברית לא מתחילה מטקסט, היא מתחילה מדמות. קודם מחליטים מי מדבר, אחר כך מה הוא אומר, ורק בסוף לוחצים Generate.