ארגון ה-AI הישראליארגון ה-AI הישראלי
תמונה של AI

📷 מקור: www.technologyreview.com

חדשות AIמאמרים ומחקרים

האם הבינה המלאכותית באמת חכמה כמו שמספרים לנו, או שהמדדים פשוט שבורים?

✍️ליאור אברהם

האשליה של מבחני הבינה המלאכותית

מאז תחילת דרכה של הבינה המלאכותית, המדד המרכזי והפופולרי ביותר להצלחה היה פשוט מאוד: האם המכונה יכולה לנצח את האדם? ראינו את זה קורה במשחקי לוח מורכבים כמו שחמט, בפתרון משוואות מתמטיות סבוכות, בכתיבת קוד תכנותי ואפילו בחיבור מאמרים אקדמיים. הסיפור הזה של "אדם מול מכונה" הוא מרתק, סקסי ומושך תקשורתית, אבל הוא יצר אצלנו אשליה מסוימת לגבי המציאות.

בראשית ימי מודלי השפה הגדולים, היינו עדים לקפיצות מדרגה עצומות – שיפורים של כמעט פי 10 ביכולות הקידוד וההיגיון מגרסה לגרסה. אולם, כיום אנו רואים שהקפיצות הללו מתמתנות והופכות שטוחות יותר, והשיפורים הופכים להדרגתיים ושוליים. האם זה אומר שהבינה המלאכותית נעצרה במקום? ממש לא. זה אומר שהמדדים שלנו פשוט הפסיקו לשקף את המציאות הטכנולוגית בצורה מהימנה.

למה המדדים הנוכחיים פשוט שבורים?

הבעיה המרכזית כיום היא שמפתחי מודלים רבים התחילו לשחק את המשחק של "לעבור את המבחן". במקום להשקיע את מירב המאמצים בשיפור היכולות הכלליות של הבינה המלאכותית ובהבנה עמוקה שלה, הם מאמנים את המודלים הספציפיים שלהם כך שיקבלו ציונים גבוהים במדדים המקובלים (Benchmarks).

התופעה הזו מובילה למצב אבסורדי שבו מודל שפה יכול לקבל ציון כמעט מושלם במבחן תכנות בשפה אחת או במשימה תיאורטית, אבל להיכשל לחלוטין כשהוא נדרש לבצע משימה דומה בשפת תכנות אחרת, או גרוע מכך – בסביבת עבודה עסקית ואמיתית. התוצאה היא שוק שמלא בהצהרות מפוצצות על יכולות חסרות תקדים, בשעה שבפועל, הכלים מתקשים לעיתים קרובות לספק את הסחורה במשימות היומיומיות החשובות באמת.

משבר ההערכה: כשהציון לא משקף את המציאות

חוקרים ומדענים בתחום הבינה המלאכותית מכנים את התופעה המטרידה הזו "משבר ההערכה" (Evaluation Crisis). כשמדדים בתעשייה הופכים לחסרי תוקף, הם לא באמת מודדים את מה שהם מתיימרים למדוד. דמיינו תלמיד שמשנן את כל התשובות למבחן הבגרות בצורה רובוטית, מקבל את הציון 100, אבל מחוץ לכותלי בית הספר לא מסוגל ליישם את החומר בחיים האמיתיים או לפתור בעיות בלתי צפויות.

📬

רוצים לקבל עדכוני AI ישירות לאימייל?

הצטרפו לאלפי מנהלים שמקבלים את הניוזלטר השבועי שלנו

זה בדיוק מה שקורה היום עם לא מעט ממודלי הבינה המלאכותית שמתגאים בראש טבלאות הדירוג. עבור ארגונים ועסקים שמשקיעים הון עתק, זמן ומשאבים בהטמעת טכנולוגיות AI בארגון, המשבר הזה מהווה סיכון ממשי. הם עלולים לבחור כלים על סמך נתונים שגויים ולהתאכזב קשות כשהטכנולוגיה תפגוש את העובדים או את לקוחות הקצה ותקרוס תחת העומס.

הפתרון: למדוד את מה שבאמת חשוב בעולם האמיתי

כדי לצאת מהמשבר הזה ולהחזיר את האמון בטכנולוגיה, הקהילה המדעית, ובראשה חוקרים מ-MIT, מציעה גישה חדשה: הערכה מבוססת תוקף. הגישה הזו, ששואבת השראה משיטות מחקר מעמיקות במדעי החברה, דורשת מאיתנו להגדיר מחדש מהי בעצם "יכולת". במקום לתת ציון כללי וסתמי, ההצעה היא לפרק כל יכולת לתתי-מיומנויות קטנות ומדידות, ולקשר את המבחנים ישירות למשימות מהעולם האמיתי. עלינו להפסיק לשאול "האם ה-AI חכם יותר מהאדם בטריוויה?" ולהתחיל לשאול "האם ה-AI באמת עוזר לעובד לבצע את המשימה הספציפית שלו טוב יותר, באמינות גבוהה יותר, ובפחות זמן?".

איך ייראה עתיד המבחנים של הבינה המלאכותית?

כבר עכשיו אנחנו זוכים לראות התארגנויות חדשות בתעשייה שנועדו לשנות את חוקי המשחק מהיסוד. יוזמות כמו BetterBench, לצד מאמצים של ארגוני מחקר בולטים כמו Hugging Face ו-EleutherAI, פועלות במרץ ליצירת מדדים שקופים, אמינים ומדויקים יותר. העתיד של בדיקות הבינה המלאכותית נמצא ביכולות מותאמות-תחום. במקומות שבהם מודל מוזן בידע הארגוני הספציפי ועובר התאמה אישית לצרכים מדויקים (למשל ברפואה או משפטים), אנחנו עדיין רואים קפיצות מדרגה אמיתיות ומרגשות ביעילות. שם נמצא הערך האמיתי עבור החברה האנושית, ושם בדיוק המדדים החדשים צריכים להתמקד.

למה זה צריך לעניין אתכם ואיך תתכוננו?

ההבנה שהמדדים הנוכחיים שבורים היא קריטית לכל מי שמשתמש, מטמיע, מנהל או משקיע בבינה מלאכותית כיום. בפעם הבאה שאתם קוראים כותרת מפוצצת על מודל חדש ש"שבר את כל השיאים האפשריים", כדאי לקחת את המידע הזה בערבון מוגבל ולשאול אילו מבחנים בדיוק הוא עבר, והאם הם רלוונטיים אליכם. העולם צועד בבטחה לעבר בחינה מציאותית, הוגנת ומעשית יותר של טכנולוגיות, וזה הזמן שלנו לעדכן את הציפיות שלנו בהתאם. מכירים קולגות או חברים שמסתמכים על ציוני מודלים בעיניים עצומות? שתפו איתם את הכתבה הזו כדי שיכירו את המציאות שמאחורי הקלעים של תעשיית ה-AI ויקבלו החלטות חכמות יותר!

🔗

מקור הכתבה

Technologyreview
הצטרפו לקבוצת הווטסאפ שלנו לעדכונים

תגיות:

שתפו את הכתבה:

עוד כתבות שיעניינו אותך

תנסו לחיות עוד 10 שנים: האם גל תרופות ה - AI יצא בקרוב  מהמעבדות למדפים?
חדשות AI, רפואת AInytimesליאור אברהם30 באוגוסט

תנסו לחיות עוד 10 שנים: האם גל תרופות ה - AI יצא בקרוב מהמעבדות למדפים?

גל התרופות המבוססות AI יוצא מהמעבדות אל בתי המרקחת. איך הטכנולוגיה משנה את הטיפול בסרטן, מי תהיה ה NVIDIA של עולם הרפואה, ומהם האתגרים המדעיים בדרך?

גוגל פותחת את מודל הדיבור המתקדם שלה: מהפכה ארגונית בפתח?
חדשות AIarchive.thedeepview.comליאור אברהם30 באוגוסט

גוגל פותחת את מודל הדיבור המתקדם שלה: מהפכה ארגונית בפתח?

גוגל הופכת את יכולות הדיבור המתקדמות ביותר שלה לפלטפורמה פתוחה, מה שמעיד על שינוי אסטרטגי עמוק בעולם הבינה המלאכותית הקולית. מהלך זה טומן בחובו פוטנציאל אדיר עבור ארגונים ועסקים המבקשים לשלב יכולות שיחה מלוטשות ואינטואיטיביות במערכותיהם.

קלאודפורס נחשפת: המיזוג האסטרטגי בין סיילספורס לאנתרופיק משנה את ה-CRM
חדשות AIarchive.thedeepview.comליאור אברהם29 באוגוסט

קלאודפורס נחשפת: המיזוג האסטרטגי בין סיילספורס לאנתרופיק משנה את ה-CRM

שיתוף הפעולה פורץ הדרך בין ענקיות הטכנולוגיה סיילספורס ואנתרופיק, המכונה 'קלאודפורס', מבטיח להטמיע יכולות בינה מלאכותית אג'נטית מתקדמות בליבת הפעילות הארגונית. שותפות זו עשויה להגדיר מחדש את האופן שבו עסקים מנהלים קשרי לקוחות, תהליכי מכירה ושירות, ולהוביל למהפכה של ממש בפרודוקטיביות.

אנתרופיק משלבת דפדפן פנימי בסביבת העבודה של Claude Cowork
חדשות AIclaude.comליאור אברהם29 באוגוסט

אנתרופיק משלבת דפדפן פנימי בסביבת העבודה של Claude Cowork

חברת אנתרופיק משדרגת את יכולות האוטומציה המשרדיות של מודל Claude ומציגה דפדפן מובנה עצמאי המבצע פעולות מורכבות ברשת ללא צורך בהתקנת תוספים. הפיתוח החדש מאפשר לארגונים ולעובדים להאציל משימות דפדפן מרוחקות ישירות לסוכן ה-AI תוך שמירה קפדנית על פרטיות ואבטחת מידע.

10 פקודות נסתרות ל-ChatGPT  ו - Gemini שיהפכו אתכם למאסטרים של בינה מלאכותית
חדשות AIליאור אברהם29 באוגוסט

10 פקודות נסתרות ל-ChatGPT ו - Gemini שיהפכו אתכם למאסטרים של בינה מלאכותית

חושבים שאתם מנצלים את מלוא הפוטנציאל של כלי ה - AI? תחשבו שוב. הכירו את מצבי החשיבה שמשנים את כללי המשחק ויגרמו לבינה המלאכותית לעבוד בדיוק לפי הצרכים שלכם.

האות האדום: סוכני AI אוטונומיים מאיימים על הסייבר – שוק הביטוח מגיב
חדשות AIaisecret.usליאור אברהם29 באוגוסט

האות האדום: סוכני AI אוטונומיים מאיימים על הסייבר – שוק הביטוח מגיב

שוק הביטוח העולמי מצביע על איום סייבר חדש וחסר תקדים: סוכני בינה מלאכותית אוטונומיים שיוצאים משליטה. זו אינה עוד היפותזה, אלא סיכון מתומחר המאלץ ארגונים לשקול מחדש את אסטרטגיות ההגנה שלהם.

Nvidia ו-Hugging Face: המהלך שישנה את פני ה-AI הארגוני?
חדשות AIarchive.thedeepview.comליאור אברהם28 באוגוסט

Nvidia ו-Hugging Face: המהלך שישנה את פני ה-AI הארגוני?

ענקית השבבים Nvidia צפויה לבצע רכישה אסטרטגית שעשויה לטלטל את אקוסיסטם ה-AI, תוך שהיא חורגת מתחום החומרה המסורתי שלה. מהלך זה, המכוון לשליטה בשער החדשנות הפתוחה, טומן בחובו השלכות עמוקות עבור ארגונים ומפתחים ברחבי העולם.

Nvidia חושפת את עתיד ה-AI הארגוני: NVLink Fusion וזיכרון NVHBM מותאם אישית
חדשות AIbayarealetters.comליאור אברהם28 באוגוסט

Nvidia חושפת את עתיד ה-AI הארגוני: NVLink Fusion וזיכרון NVHBM מותאם אישית

Nvidia מציגה קפיצת מדרגה טכנולוגית משמעותית עם NVLink Fusion וזיכרון NVHBM מותאם אישית, המבטיחים ביצועי שיא וחיסכון באנרגיה. פריצת דרך זו עשויה לעצב מחדש את תשתית ה-AI הארגונית ואת יכולות עיבוד הנתונים בקנה מידה חסר תקדים.

התחזית שזעזעה את וול סטריט: Nvidia מאותתת – קדחת ה-AI רק מתחילה
חדשות AIaisecret.usליאור אברהם28 באוגוסט

התחזית שזעזעה את וול סטריט: Nvidia מאותתת – קדחת ה-AI רק מתחילה

חברת Nvidia, ענקית השבבים, שברה השבוע שתיקה מסורתית בת שלושה עשורים והציגה תחזית צמיחה מדהימה של 70% לשנה הפיסקלית הבאה, הרבה מעבר לציפיות האנליסטים. מהלך חסר תקדים זה אינו רק מספר, אלא איתות ברור לשוק כולו: קצב ההתפתחות וההשקעה בתחום הבינה המלאכותית רק הולך ומתעצם, והוא רחוק משיא.

המהפכה השקטה: האם מודלי AI סיניים ינצחו במירוץ היעילות ויוזילו את הבינה המלאכותית לארגונים?
חדשות AIarchive.thedeepview.comליאור אברהם27 באוגוסט

המהפכה השקטה: האם מודלי AI סיניים ינצחו במירוץ היעילות ויוזילו את הבינה המלאכותית לארגונים?

השקת מודלים חדשניים מסין מציבה סטנדרט חדש בתחום היעילות העלות-תועלת בבינה מלאכותית, ומאתגרת את הדומיננטיות של הענקיות המערביות. מגמה זו מבשרת על עידן חדש שבו בינה מלאכותית מתקדמת תהיה נגישה יותר ובמחיר סביר יותר עבור עסקים בכל הגדלים.

הצטרפו אלינו