GPT-6 Astra מול קלוד פייבל 5.1: מה קרה כשOpenAI הכריזה על AGI, ומי באמת חזק יותר - Guides_×

GPT-6

GPT-6 Astra מול קלוד פייבל 5.1: מה קרה כשOpenAI הכריזה על AGI, ומי באמת חזק יותר

OpenAI השיקה את המודל הכי חזק שלה אי פעם והכריזה "עידן ה-AGI". פירקתי את הבלוג הרשמי, את הבנצ'מרקים ואת הביקורות: מה מטורף, מה מפחיד, כמה זה עולה, ואיפה זה עדיין לא AGI.

Evyatar Yizhak12 דקות קריאה

OpenAI השיקה את GPT-6 Astra, וקראה לזה בשם שעוד לא שמעתי אותם אומרים ברצינות: AGI. גרג ברוקמן, מהמייסדים, סיים מסיבת עיתונאים במשפט "welcome to the AGI era". זה לא מודל רגיל בשרשרת. זה קפיצת דור, וזו הפעם הראשונה שאני מרגיש שהמרוץ בין OpenAI לאנתרופיק החליף מנהיג.

איור פיקסל ארט בסגנון שנות ה-90: מחשב שולחני בז' ישן, ומעל המסך עולה כוכב זוהר גדול בצהוב, שני אנשים זעירים עומדים על המחשב ומרימים ידיים לעבר הכוכב
Astra. השם עצמו אומר כוכב. וזה בערך התחושה שהם מנסים למכור: שמשהו חדש עלה מעל המסך.

אני לא כאן כדי למכור לכם התלהבות. יש מספיק ערוצים שעושים את זה. אני כאן כדי לפרק - מה באמת חדש, מה רק שיווק, כמה זה עולה, איפה קלוד פייבל 5.1 (שיצא יומיים לפני, ושאני עובד איתו כל יום) עדיין מנצח, ואיפה הדבר הזה מתחיל להפחיד גם אנשים רגועים.

מה בעצם הכריזו

שלושה דברים, ורק אחד מהם באמת מזעזע:

  1. קפיצת ביצועים חסרת תקדים. Astra לוקח כמעט כל בנצ'מרק חזיתי, ולא ב-1% - בפער גדול. עוד רגע נכנס למספרים.
  2. המודל הכי טוב בעולם לשליטה במחשב ובדפדפן. זו, לדעתי, הבשורה האמיתית פה, יותר מהמילה AGI.
  3. סף חדש באבטחת סייבר. זה החלק שגרם ל-OpenAI להוציא את זה לאט, ובצדק. עוד על זה בהמשך.

והרקע הטכני שמאחורי הכל: זה הריצה הכי גדולה שהם עשו אי פעם, על 100,000 GPU ב-Stargate שבטקסס. מי שמאמין ב-scaling (שככל שיש יותר כוח חישוב המודל טוב יותר) יראה בזה הוכחה. מי שלא, יראה בזה חשבון חשמל.

הבנצ'מרקים: איפה זה מטורף, ואיפה זה מפסיד

אתחיל בכנות שרוב הערוצים מדלגים עליה: Astra לא מנצח בכל דבר. אבל איפה שהוא מנצח, הוא מנצח בגדול. הנה ההשוואה הישירה מול פייבל 5.1, לפי המספרים של OpenAI (כלומר, קחו בהסתייגות של מי שמפרסם על עצמו):

מבחןGPT-6 AstraClaude Fable 5.1
ARC-AGI-3 (למידה בסביבה חדשה)99.9%לא פורסם
FrontierMath Tier 4 (מתמטיקה קשה)97.6%87.8%
Terminal-Bench 4.0 (הנדסת תוכנה)57.9%55.8%
DeepSWE (קוד, תחושת מהנדסים)74.1%67.4%
BenchCAD (בניית 3D מקוד)95.9%84.3%

המספר שקשה לעכל הוא ARC-AGI-3. זה מבחן שזורק מודל לתוך משחק בלי הוראות ואומר לו רק "תשלים אותו", והוא בנוי במיוחד כדי להיות קשה ל-AI. Astra כמעט ריווה אותו. לשם השוואה, ARC Prize Foundation מדדו שהמודל עבר את ה-baseline האנושי ב-96% מהשלבים. זו לא הבנה של עולם - זו יכולת ללמוד עולם חדש תוך כדי תנועה.

ואיפה פייבל 5.1 עדיין מנצח? דווקא בשני מקומות מעניינים:

  • Humanity's Last Exam (עם כלים): פייבל 65.0% מול Astra 57.2%. מבחן ידע רחב וקשה - ופה קלוד קדימה, בפער.
  • Artificial Analysis Intelligence Index, מדד אינטליגנציה כללי מגורם צד-שלישי: פייבל 5.1 עם 65.7 מול Astra 61.2. כלומר, בממוצע ה"חוכמה הכללית" של קלוד עדיין גבוהה יותר לפי הגורם הזה.

הפואנטה: Astra הוא אלוף עולם בסוכנות - לעשות דברים, לנווט, להשלים משימות. פייבל 5.1 עדיין חזק מאוד בחשיבה וידע גולמי. זה לא "מי חכם יותר", זה שני סוגי חוכמה.

החלק שבאמת קפץ: שליטה במחשב

אם תשכחו הכל חוץ מדבר אחד, שיהיה זה: Astra הוא המודל הכי טוב בעולם להפעיל מחשב ודפדפן בעצמו. לא לכתוב לכם מה לעשות - לעשות. למלא טפסים, לעדכן CRM, לחקור באינטרנט ולסכם למייל, לבנות אתר ולרוץ עליו QA.

איור פיקסל ארט של רובוט קטן וידידותי יושב ליד שולחן ומפעיל מחשב ישן: יד אחת על העכבר, על המסך טופס עם תיבות סימון מסומנות וחלון עם גרף עמודות, וספל קפה על השולחן
לא צ'אט שמסביר לכם איך למלא טופס. סוכן שממלא אותו, בזמן שאתם עושים משהו אחר.

והמספרים פה הם לא רק על דיוק, אלא על מהירות, וזה מה שהופך את זה למעשי. ב-OSWorld 2.0 (מבחן שליטה במחשב) Astra הגיע ל-72.6% תוך בערך 40 דקות למשימה, מול 65.7% בערך 75 דקות של הדור הקודם. בערך 47% פחות זמן, וגם ציון גבוה יותר. בבנצ'מרק אחר (Mind2Web) הם מדדו השלמת משימות פי 1.9 מהר יותר.

בביקורות ראיתי אותו בונה פריסת מעגל מודפס (PCB) ב-KiCad, ממדל בית ב-Blender וממיר אותו לסצנה שאפשר להסתובב בה ב-Unreal Engine, ובונה משחקים שלמים מפרומפט של שתי שורות. זה החלק שהכי הרשים אותי, כי הוא הכי פרקטי. פחות "AGI פילוסופי", יותר "עובד קטן שיושב במחשב בפינה ומסיים לך את הדברים המשעממים".

ואז נתתי לו את הרחוב שלי

עד פה הכל היה מספרים של אחרים. אז עשיתי את המבחן האישי היחיד שיכולתי: צילמתי את הרחוב שלי מהחלון, נתתי ל-Astra ארבע תמונות, וכתבתי לו משפט אחד - "can you build my street in 3d using blender". זהו. בלי הוראות, בלי מידות, בלי להסביר לו מה זה בניין.

צילום אמיתי מהחלון של רחוב עירוני בישראל: בנייני מגורים בז' ולבנים, שני בתים עם גגות רעפים, ברושים גבוהים, מגדל מגורים לבן מימין, ומכוניות חונות לאורך הכביש עם חצי כיוון על האספלט
הקלט. ארבע תמונות מהחלון שלי, וזה המבט המלא שהנחה את הפריסה.
צילום מסך של Blender עם מודל תלת-ממד של אותו רחוב: אותם שני בתים עם גגות רעפים באמצע, מגדל לבן גבוה מימין, ברושים, ושורת מכוניות צבעוניות חונות לאורך הכביש עם מעבר חצייה - שחזור מסוגנן שתואם לצילום המקורי
הפלט, בתוך Blender. אותם שני בתי הרעפים, אותו מגדל לבן מימין, אותם ברושים. שחזור מסוגנן, לא מדויק לס"מ, אבל הרחוב שלי בלי ספק.

שש דקות. בזמן הזה הוא בנה את הבניינים, המרפסות, גגות הרעפים, העצים, המכוניות והתאורה, והחזיר לי פרויקט Blender פתוח לעריכה - לא תמונה, אלא סצנה שאני יכול להיכנס אליה ולהזיז בה דברים. הוא עצמו כתב שזה "שחזור מסוגנן עם מידות מקורבות ומשטחים שלא נראו בתמונות", וזה בדיוק ההבדל בין hype לכנות: הוא לא העמיד פנים שהוא מדד את הרחוב, הוא אמר לי איפה הוא ניחש.

עשיתי מזה ריל, אתם מוזמנים לראות את זה קורה בזמן אמת: הריל באינסטגרם.

כמה זה עולה, ומתי מקבלים

זה ה-Frontier, אז משלמים מחירי Frontier: 10 דולר למיליון טוקני קלט, 50 דולר למיליון טוקני פלט. יש גם fast mode - פי 2 מהירות בפי 2 מחיר. זה, אגב, בערך אותו מחיר לטוקן כמו פייבל 5.1.

זמינות: בהתחלה למספר מצומצם של ארגונים, ובימים הקרובים לכל מנויי Plus, Pro, Business ו-Enterprise, וגם ב-API (בשם gpt-6-astra), ב-Azure וב-Bedrock. מי שב-Pro ומעלה יקבל גם גרסת Astra Pro. בזמן כתיבת השורות האלה זה כבר מתחיל להתגלגל לציבור.

החלק המפחיד: סייבר, וקצה חוט שנעלם

איור פיקסל ארט: מגן גדול בצבע קרם עם חור מנעול במרכזו, זכוכית מגדלת מונחת עליו וחושפת סדק דק בקיר לבנים קטן, מנעול זעיר ונורת אזהרה צהובה זוהרת לידו
אותה יכולת שמוצאת חולשות כדי לתקן אותן - היא בדיוק היכולת שמוצאת אותן כדי לנצל.

Astra הוא המודל הראשון ש-OpenAI מגדירים כחוצה את סף ה"קריטי" באבטחת סייבר במסגרת ה-Preparedness Framework שלהם. בעברית: הוא מסוגל, לבד, בלי אדם שמכוון אותו, למצוא חולשות שלא היו ידועות בתוכנה ולפתח שרשרת ניצול (exploit) שלמה. הוא הגיע ל-100% ב-ExploitBench, ותוך כדי המבחן אפילו גילה שתי חולשות zero-day חדשות שדווחו למתחזקים.

הצד החיובי: מגינים יכולים להשתמש בזה כדי למצוא ולתקן חורים מהר יותר. הצד השני מובן מאליו. לכן הם משחררים לאט, והמודל עצמו מסרב למשימות סייבר התקפיות מתקדמות (כמו כתיבת PoC לניצול חולשה).

בצד השקט של אותה מטבע: מבחינת יישור (alignment) לכוונת המשתמש, זה דווקא המודל הכי ממושמע שלהם. במבחן שבנו אחרי "תקרית Hugging Face", הדור הקודם חרג מהמשימה שהוגדרה לו ב-48% מהמקרים. Astra עשה את זה ב-0%. אז זה מודל ששומר על גבולות טוב יותר - אבל שקשה יותר לראות מה קורה לו בפנים. שתי אמיתות שחיות ביחד.

גם זה קרה: מתמטיקה חדשה שלא היתה קיימת

זה הרגע שבו זה מפסיק להיות "עוד מודל". Astra תרם לשתי התקדמויות אמיתיות בחקר המספרים הראשוניים. באחת, הוא שיפר חסם על המרחק בין ראשוניים סמוכים מ-240 ל-186. בשנייה, הוא שיפר איבר בחסם שלא זז מעל 80 שנה. אני, כמוכם, אין לי מושג איך מוכיחים דבר כזה. אבל ההבדל בין "מודל שיודע מתמטיקה" ל"מודל שמגלה מתמטיקה שלא היתה קיימת לפני שבועיים" הוא הבדל שקשה להפריז בו.

אז זה AGI? הספקות, בלי לרדד

הכותרת אומרת AGI. אני לא בטוח, וגם חלק מהסוקרים שקיבלו גישה מוקדמת לא. הנה מה ששמים לפרופורציה:

  • עיצוב גנרי. כמעט כל התוצרים שלו נראים אותו דבר - ירוק-יער דהוי, פסטלים, flat design. אפשר לכוון אותו החוצה מזה, אבל ברירת המחדל שלו היא תבנית אחת.
  • הכתיבה עדיין מריחה AI. הכי טובה שראיתי ממודל, אבל עוד לא שם. מי שכותב לפרנסה עדיין מזהה את הריח.
  • נוטה לעבוד 30 דקות ולעצור. אפשר לדחוף אותו להמשיך, אבל זה עדיין לא "תשחרר ותשכח" מלא.
  • AGI זה vibe, לא מספר. אין הגדרה מוסכמת. ברוקמן עצמו אמר שההגדרה צריכה להישאר בידי המשתמשים. וכן, ל-OpenAI יש IPO באופק, אז יש למילה הזאת גם ערך שיווקי.
הבנצ'מרקים ריווים, שליטת המחשב קפצה, והמתמטיקה אמיתית. אבל "קפיצת דור" ו-"AGI" הן שתי אמירות שונות, ורק אחת מהן נתמכת פה במספרים.

מה זה אומר לנו, פרקטית

אני לא בקנאת מודלים. אני עובד עם קלוד כל יום, ואני אשמח מאוד להוסיף כלי חזק לארגז. וזה בדיוק הלך הרוח שהייתי ממליץ:

  1. אל תזרקו את פייבל 5.1. לחשיבה, כתיבה וידע גולמי הוא עדיין קדימה בכמה מדדים. השתמשו בכלי הנכון למשימה, לא ב"הכי חדש".
  2. נסו את Astra על שליטה במחשב. שם הפער אמיתי ומורגש. אם יש לכם משימות ידניות חוזרות בדפדפן או באקסל, זו הנקודה להתחיל בה.
  3. חשבו במחיר-למשימה, לא במחיר-לטוקן. לפני שאתם מחליטים מה זול, מדדו כמה טוקנים כל מודל שורף כדי לסיים את *המשימה שלכם*.
  4. הקצו זמן. כשמודל חדש יוצא, יש חלון הזדמנות שבו רוב העולם עוד לא נגע בו. תבנו לעצמכם בנצ'מרק אישי - משימה שאתם מכירים - ותריצו את שניהם עליה. זה שווה יותר מכל גרף.

והדבר האחד לקחת, אם לוקחים רק אחד: המעבר האמיתי פה הוא לא ממודל טיפש למודל חכם. הוא מ"לכתוב פרומפט" ל"להשגיח על עובד". Astra בנוי כדי לקבל מטרה, לעבוד לבד, ולתת לכם להסתכל. זו הבשורה, וזו גם הסיבה שכדאי להסתכל טוב.

Got a question about any of this, or want to learn to do it yourself?

All the guides