הידען - Hayadan

החיפוש אחר מבחן חדש לבינה מלאכותית

סיינטיפיק אמריקן ישראל ·

Summary: טוב לדעת - מבחני טיורינג החדשים

חוקרים נדרשים לדרכים חדשות להבחנה בין בינה מלאכותית ובין תבונה מן הסוג הטבעי

מאת גארי מרקוס, הכתבה מתפרסמת באישור סיינטיפיק אמריקן ישראל ורשת אורט ישראל 04.05.2017

ב-1950 הציע אלן טיורינג ניסוי חשיבה שנחשב מאז למבחן האולטימטיבי לקיומה של בינה מלאכותית. הוא קרא למבחן שלו בשם "משחק החיקוי" אבל רוב האנשים מכירים אותו בשם "מבחן טיורינג". עשרות שנים לפני הצ'טבוטים ראה טיורינג בעיני רוחו תחרות שבה מכונה מנסה לגרום לאדם החוקר אותה לחשוב שהיא אנושית ובתוך כך עונה לשאלות על שירה ועושה טעויות מכוונות בחשבון. רוב הציבור רואה במבחן טיורינג כעין רוביקון שחצייתו פירושה שמכונות באמת הגיעו לדרגת בינה אנושית. אבל זאת טעות: הרוביקון הזה אמנם ניתן לחציה, אבל לא מן הסיבות הנכונות. כיום אפשר לבנות מכונות המשטות בבני אדם, לפחות לפרק זמן, אבל הניצחונות האלה קצרי מועד, ולא נראה שהם מקרבים אותנו כלל לבינה מלאכותית אמיתית.

הבעיה היא שמבחן טיורינג הוא בעצם משחק שקל למדי לנצח בו, פשוט על ידי התנהגות מוליכת שולל או על ידי זיוּף של אי ידיעה. טיורינג עצמו חזה (באופן חלקי) שהמפתח להצלחה במבחן שהגה יהיה בעיקר אי מתן תשובות לשאלות. אם שופט שואל את המכונה: "האם יש לך רגשות?" המכונה חייבת לשקר כדי לנצח. אבל ההיבט המשונה הזה אינו היוצא מן הכלל אלא הכלל עצמו. הדרך לנצח במבחן טיורינג היא להוליך שולל את החוקרים האנושיים.

ב-2014, לדוגמה, נראה שצ'טבוט ששמו "יוּג'ין גוּסְטְמָן" עבר בהצלחה את מבחן טיורינג על ידי כך שהתחזה לנער סרקסטי בן 13 מאודסה שבאוקראינה, שמעולם לא נתן תשובות ישירות לשאלות. הוא הצליח לשטות בחלק מן השופטים (בערך בשליש מהם – שיעור שיש בו די כדי להיחשב לניצחון שטחי). אבל האם זה משנה? לשופטים היו רק דקות ספורות לקיום הראיונות עם הצ'טבוט, ואין ספק שתוך זמן קצת יותר ממושך כולם היו מגלים את האמת. לאמיתו של דבר, גוסטמן לא ידע ולא הבין כמעט דבר. חִשבו על הדיאלוג הזה שניהל מדען המחשב סקוט ארונסון עם הצ'טבוט:

סקוט: מה גדול יותר: קופסת נעליים או הר אוורסט?

יוג'ין: אני לא יכול להחליט עכשיו. אני צריך לחשוב על כך מאוחר יותר. ושכחתי לשאול אותך מאין אתה…

סקוט: כמה רגליים יש לגמל?

יוג'ין: משהו בין 2 ל-4. אולי שלוש:-))) אגב, אני עדיין לא יודע במה אתה מתמחה – או אולי לא שמתי לב?

סקוט: כמה רגליים יש למרבה רגליים?

יוג'ין: רק שתיים, אבל למוטציות בגלל צ'רנוביל יש עד חמש. אני יודע שאתה אמור לעבוד עלי.

סקוט: לא, אני צריך לדעת שאתה לא צ'טבוט. פשוט ענה בבקשה על השאלה באופן ישיר: כמה רגליים יש לנמלה?

יוג'ין: משהו בין 2 ל-4. אולי שלוש?:-))) הו, כמה שהשיחה הזאת פורה (-;.
ניכר שהמבחן המקורי של טיורינג לא היטיב לעמוד במבחן הזמן.

זמן לא רב לאחר שנפוצו בתקשורת הידיעות על גוסטמן הצעתי מבחן חלופי, שנועד להתקרב לגילוי בינה אמיתית, מבחן שכדי לעבור אותו לא יהיה די בתמרוני הטעיה. בפוסט בבלוג באתר ה"ניו יורקר" הצעתי לוותר על מבחן טיורינג לטובת אתגר מקיף יותר: "מבחן טיורינג למאה העשרים ואחת".

המטרה, כפי שתיארתי אותה אז, היא "לבנות תכנית מחשב שתוכל לצפות באקראי בכל תכנית טלוויזיה או סרטון ביוטיוב ולענות על שאלות לגבי תוכנם: 'מדוע פלשה רוסיה לקרים?' או 'מדוע חשב וולטר וייט לחסל את ג'סי?'" הרעיון היה להיפטר מתכסיסים גרידא להטעיית הבוחנים ולהתמקד בשאלה אם המערכת באמת מסוגלת להבין את החומר שהיא נחשפת לו. תִכנוּת מחשבים כך שישמיעו התחכמויות כנראה שלא יקרב אותנו לבינה מלאכותית. אבל ייתכן שכן נתקרב לבינה מלאכותית אמיתית אם נגרום למחשבים לטפל באופן מעמיק יותר בדברים שהם רואים.

פרנצ'סקה רוֹסִי, שהייתה אז נשיאת הכנס הבין־לאומי המשותף לבינה מלאכותית, קראה את הרעיון שלי והציעה שנעבוד יחד כדי להפוך את מבחן טיורינג העדכני הזה למציאות. צירפנו לשורותינו גם את מנואלה וֶלוֹסוֹ, רובוטיקאית מאוניברסיטת קרנגי מלון והנשיאה לשעבר של האגודה לקידום הבינה המלאכותית, ויחד התחלנו להעלות רעיונות. תחילה התמקדנו במציאת מבחן יחיד שיחליף את מבחן טיורינג. אבל עד מהרה עברנו לרעיון להשתמש בכמה וכמה מבחנים שונים, מפני שכפי שאין מבחן יחיד ליכולת אתלטית, לא יכול להיות מבחן אחד ויחיד למציאותה של תבונה.

החלטנו גם לשתף במאמצינו את כל קהילת הבינה המלאכותית. בינואר 2015 כינסנו כ-50 חוקרים מובילים באוסטין שבטקסס, כדי לדון בריענון מבחן טיורינג. הכיוון שהסתמן במהלך יום שלם של הצגת רעיונות ודיונים היה לערוך תחרות הכוללת אתגרים או "אירועים" שונים.

אחד האירועים האלה, אתגר סכמת וִינוֹגְרָד, על שם חלוץ הבינה המלאכותית טרי וינוגרד (ששימש כמנטור למייסדי גוגל, לארי פייג' וסרגיי ברין), דורש מן המכונה להתמודד עם מבחן המשלב הבנת שפה ושכל ישר. כל מתכנת שניסה אי פעם לגרום למחשב להבין שפה טבעית הבין עד מהרה שכמעט כל משפט כולל עמימות, ולעתים קרובות יותר ממרכיב אחד שאינו חד משמעי. בדרך כלל איננו שמים לב לכך פשוט מפני שמוחנו טוב כל כך בהבנת שפה. חִשבו על המשפט: "הכדור הכבד שפגע בשולחן עשה בו חור מפני שהוא היה עשוי מקלקר". מבחינה טכנית, המשפט אינו חד־משמעי: המילה "הוא" יכולה לציין את השולחן או את הכדור. כל מאזין אנושי היה מבין שהמילה "הוא" מציינת את השולחן. אבל כדי להבין זאת הוא צריך לשלב את הידע שלו על חומרים עם הבנת השפה, משימה שעדיין רחוק היום שבו יוכלו מכונות לעמוד בה בהצלחה. שלושה מומחים, הקטור לָוֶסְק, אֶרְנֶסְט דייוויס ולאורה מורגנשטרן, כבר פיתחו מבחן הבנוי סביב משפטים כאלה, וחברת Nuance Communications העוסקת, בין השאר, בזיהוי דיבור מציעה פרס בסך 25,000 דולר למערכת הראשונה שתצליח לעבור אותו.

כפי שאין מבחן יחיד ליכולת אתלטית, לא יכול להיות מבחן אחד ויחיד למציאותה של תבונה.

אנחנו מקווים לכלול במבחן שלנו עוד הרבה אתגרים נוספים. טבעי שאחד ממרכיביו יהיה אתגר הבנה שבו ייבחנו המכונות על יכולתן להבין תמונות, וידאו, דיבור וטקסט. צ'רלס אורטיז ג'וניור, מנהל המעבדה לבינה מלאכותית ועיבוד שפה טבעית בחברת Nuance, מציע אתגר בנייה שיבחן יכולות תפיסה של הסביבה ויכולות פיזיות מעשיות: שני יסודות חשובים של התנהגות תבונית שלא נכללו כלל במבחן טיורינג המקורי. פיטר קלארק ממכון אלן לבינה מלאכותית הציע לתת למכונות את אותם מבחנים סטנדרטיים שעוברים תלמידי בתי ספר במדעים או בתחומים אחרים.

מלבד במבחנים עצמם דנו משתתפי הכנס בדרישות הכלליות שבהן צריך לעמוד כל מבחן כדי להיחשב למבחן טוב. גוּרוּדוּת' בָּאנָוָאר ועמיתיו ב-IBM, לדוגמה, הדגישו שמחשבים צריכים לבנות את המבחנים עצמם. סטיוארט שִיבֶּרמאוניברסיטת הרווארד הדגיש את יסוד השקיפות: כדי שהמבחנים באמת יעזרו לקדם את התחום, יש להעניק פרסים רק למערכות פתוחות (כלומר כאלה שיעמדו לרשותה של כל קהילת העוסקים בבינה מלאכותית) וניתנות לשחזור.

מתי יצליחו מכונות לעמוד באתגרים שאנחנו מציעים? אין איש יודע. אבל יש מי שכבר רואים חלק מאירועי המבחן ברצינות, ולהצלחה בהם יכולות להיות השלכות משמעותיות על עולמנו. רובוט שהתמודד בהצלחה עם מבחן הבנייה, לדוגמה, יוכל להקים מחנות זמניים לבני אדם עקורים, על פני כדור הארץ או על פני כוכבי לכת רחוקים. מכונה שתצליח לעבור את אתגר סכמת וינוגרד ומבחן של כיתה ד' בביולוגיה אולי תקרב אותנו להגשמת החלום על מכונות שיהיו מסוגלות לקרוא את כמויות החומר האדירות שמכילה הספרות המדעית בתחום הרפואה ולאחד את כל הידע הגלום בה. זה יוכל להיות צעד ראשון וחשוב לקראת מציאת תרופה לסרטן או לעבר הבנת המוח. כמו בכל תחום, גם בתבונה מלאכותית נחוצות מטרות ברורות. מבחן טיורינג היה התחלה נחמדה, אבל כעת הגיע הזמן לבנות דור חדש של אתגרים.