מערכת APT-RL משלבת מיומנויות תנועה שנלמדו מראש עם למידת חיזוק. הרובוט בוחר בעצמו מתי לרוץ, לטפס או לדלג, באמצעות חיישנים ומחשב הנמצאים על גופו
רובוט ארבע־רגלי הצליח לנוע באופן אוטונומי ביער, לטפס במדרגות, לעבור בין אבני דריכה ולקפוץ מעל גזעים שנפלו, באמצעות מערכת בקרה הבוחרת בזמן אמת בין כמה מיומנויות תנועה.
המערכת, המכונה APT-RL – ראשי תיבות של Action Pretrained Transformer–based Reinforcement Learning – פותחה בידי ג'ון־גיל קאנג ועמיתיו. המחקר מתפרסם בכתב העת Science Robotics של AAAS.
בעלי חיים בעלי ארבע רגליים מסוגלים לשנות במהירות את צורת התנועה בהתאם לשטח. הם יכולים לעבור מהליכה לריצה, להאט לפני מכשול, לזנק או לשנות את מיקום כפות הרגליים. אצל רובוטים נדרשים בדרך כלל בקרי תנועה נפרדים ותכנון מדויק לכל משימה.
החוקרים ביקשו לפתח מערכת שלא תלמד כל משימה מחדש, אלא תוכל לבחור ולשלב מיומנויות שכבר נלמדו. לשם כך חילקו את תהליך האימון לשלושה שלבים, המתקדמים מתנועות בסיסיות להתנהגות מורכבת בסביבה אמיתית.
בשלב הראשון למד הרובוט דפוסי תנועה בסיסיים, כגון ריצה קלה ודהירה, באמצעות מאגר גדול של תנועות דו־ממדיות. מיומנויות אלה שימשו מעין אוצר מילים מוטורי שעליו ניתן לבנות התנהגויות מורכבות יותר.
בשלב השני הופעלה למידת חיזוק. הרובוט התאמן בבחירת המיומנות המתאימה למצב: מתי להמשיך בריצה, מתי להאט, מתי לטפס ומתי לעבור לתנועת קפיצה. במהלך האימון קיבלה המערכת משוב על הצלחתה לעבור מכשולים תוך שמירה על יציבות ומהירות.
בשלב השלישי הותאמו הפעולות למידע מחיישנים אמיתיים. במקום להסתמך על מפה מפורטת או על מחשב חיצוני, הרובוט עיבד את המידע באמצעות מערכות התפיסה והמחשוב שעל גופו.
השילוב מאפשר מעבר מהיר בין צורות תנועה. כאשר הרובוט מזהה גזע נמוך, למשל, הוא עשוי לעבור מתנועה רציפה לקפיצה. מול מדרגות או אבנים הוא יכול לבחור תנועה אטית ומדויקת יותר, ולאחר מכן לחזור לריצה.
היכולת לעבור בין מיומנויות היא חשובה לשימוש ברובוטים בסביבות שאינן מסודרות מראש. רובוטים כאלה עשויים בעתיד לפעול באתרי אסון, במכרות, ביערות, במפעלי תעשייה או במשימות שבהן כלי רכב גלגליים מתקשים לנוע.
עם זאת, הדגמות מוצלחות במסלולי הניסוי אינן מבטיחות פעולה אמינה בכל סביבה. תנאי תאורה, בוץ, צמחייה צפופה, משטחים חלקים, מכשולים בלתי צפויים או תקלות בחיישנים עלולים עדיין להקשות על המערכת.
המחקר ממחיש מגמה ברובוטיקה: מעבר מבקר המיועד לתנועה יחידה אל מערכות המשתמשות במאגר מיומנויות ומחליטות בעצמן איזו מהן מתאימה לכל רגע.