בן ה-22 שעומד מאחורי מעבדת ה-AI הישראלית; עם גלעד לוי
עם גלעד לוי
9 Aug 20264 min read35m
TL;DR
גלעד לוי טוען שמודלי השפה הגדולים – GPT, Claude ועוד – נגיעים לתקרה מהותית: הם לא יודעים ללמוד ולהתעדכן מאינטראקציות עם משתמשים, כי ארכיטקטורת הטרנספורמר פשוט לא מאפשרת זאת ללא אימון מחדש יקר. לכן, הוא בונה ארכיטקטורה חדשה מאפס שתאפשר למודל לשנות את משקולותיו בזמן אמת – כמו מוח אנושי. לדעתו, חברות כמו OpenAI ו-Anthropic כבר לא יכולות לעשות פיבוט, כי הן תקועות בחוב של מאות מיליארדים ובנוחות-יתר של הצוות שבונה את הפרה-טריינינג.
Key Moments
גלעד לוי
“עם הארכיטקטורה הזו אנחנו לא נגיע לג' חד משמעית.”
גלעד קובע בצורה חדה שטרנספורמרים לא יובילו ל-AGI, בניגוד לדעת סם אלטמן ואחרים
גלעד לוי הוא מייסד ומנכ"ל מניפולד, מעבדת AI ישראלית הבונה foundation model – הראשונה מסוגה בישראל. הוא התחיל את התואר הראשון במדעי המחשב בטכניון בגיל 15, ופרש מהתואר השני בגיל 21 כדי להקים את החברה. בגיל 22 הוא עובד על ארכיטקטורה חדשה למודלי שפה שמטרתה לפתור את בעיית הלמידה המתמשכת – יכולת שמודלים קיימים כמו GPT ו-Claude פשוט לא מסוגלים לה.
Takeaways
1
שוק ה-LLM-as-a-service הפסדי מבנית כל חברה שמייצרת בעצמה את המודל ומוכרת טוקנים – OpenAI, Anthropic ואחרות – מפסידה כסף. מודל העסקי של בניית foundation model ומכירת inference הוא מבנית פגום, ועדיין לא נמצאה דרך לייצר ממנו רווח בלי שוק שבוי (כמו Meta שמחלקת את המודלים בחינם). יזמים ומשקיעים צריכים לשאול: מה המוניטיזציה, לא מה הבנצ'מרק.
2
חברות גדולות לא יכולות לעשות פיבוט ארכיטקטוני בחברות כמו Google ו-OpenAI, צוותי הפרה-טריינינג קטנים ומבודדים, משתכרים שמונה-תשעה ספרות בשנה, ונמצאים ב-comfort zone שלא מאפשר ביקורת על הארכיטקטורה. בנוסף, הלוואות של מאות מיליארדים נועלות אותן לתוך המסלול הקיים. זה בדיוק החלל שמאפשר לסטארטאפ קטן לחקור כיוונים שהענקיות לא יכולות לגעת בהם.
3
מודלים לא לומדים מהשתמשים – זו הבעיה הבאה בניגוד למה שמרגישים, ChatGPT היום זהה לחלוטין לאחר חודש שימוש לעומת יום אחד. מודלים לא מפנימים אינפורמציה מהשיחות, לא מכירים אותך ולא מתעדכנים. זה הסיבה שאין retention אמיתי ואין "moat" – כל מודל חזק יותר מחליף את הקודם מיד.
4
מוצר AI חייב עומק טכנולוגי שקשה להעתיק כמו שאי אפשר לגנוב את האלגוריתם של ספוטיפיי או טיקטוק רק מהממשק, מוצר AI צריך שהטכנולוגיה תהיה בלתי-נגישה לחיקוי. distillation attacks הופכים כל LLM חשוף לממשק לכזה שניתן לשכפל. ה-moat היחיד הוא להסתיר את הטכנולוגיה מאחורי חוויית מוצר עמוקה שלומדת את המשתמש לאורך זמן.
5
טרנספורמרים לא יובילו ל-AGI גלעד לוי טוען בביטחון שארכיטקטורת הטרנספורמר – הבסיס של GPT, Claude וכל המודלים הגדולים – מוגבלת מהותית ולא תספיק להגיע לבינה מלאכותית כללית. יכולות בסיס קריטיות כמו למידה מתמשכת ועדכון בזמן אמת פשוט לא אפשריות עם הארכיטקטורה הנוכחית. לכן, פריצת דרך אמיתית דורשת מחקר מדעי חדש ולא עוד סקייל.
6
Memory חיצוני הוא פלסטר, לא פתרון הפתרון הנוכחי של RAG ו-memory systems הוא אנלוגי למי שמגיע לעבודה רק עם הידע שצבר ביום הראשון ועם ערימת ניירות של כל השיחות שהיו לו. המוח האנושי משנה קונפיגורציה – המשקולות עצמן – ולמידה אמיתית תדרוש שינוי דומה ברשתות נוירונים. בלי זה, כל ה"זיכרון" הוא illusory.