גוגל מציגה את ME-POIs: תנועה אנושית כתוספת לווקטורים טקסטואליים של מקומות

מה הבעיה ש-ME-POIs פותרת
מודלי שפה יודעים לתאר מה מקום *הוא*, בית קפה, חנות, תחנת דלק, אבל לא איך משתמשים בו בפועל. שני בתי קפה באותו בלוק יכולים לקבל וקטור טקסטואלי כמעט זהה, בעוד אחד משרת נוסעים בדרך לעבודה עם תחלופה של דקות, והשני מחזיק לקוחות לתשעים דקות. חוקרים של Google Research ואוניברסיטת USC (University of Southern California) פרסמו מסגרת בשם Mobility-Embedded POIs, או ME-POIs, שמקפלת נתוני תנועה אנושית מצטברים לתוך האמבדינגים הטקסטואליים הקיימים. הרעיון פשוט: כל ביקור מקודד כווקטור קונטקסטואלי, ואז למידה ניגודית (contrastive learning) מיישרת את הביקורים האלה מול אב-טיפוס (prototype) אחד שנלמד לכל POI.
איך המנגנון עובד מתחת למכסה המנוע
כל ביקור מיוצג כשלישייה: קואורדינטות, שעת הגעה ושעת עזיבה. שלושה מקודדים מפורקים (factorized encoders) מטפלים בהם: Space2Vec למיקום רב-סקאלי, ושני מקודדי Time2Vec נפרדים לזמן הגעה ולזמן עזיבה, כך שעת התחלה ומשך שהייה נשארים מובחנים. הווקטורים המאוחדים עוברים קידוד מיקום סינוסואידלי ונכנסים לטרנספורמר בן 4 שכבות עם 8 ראשי קשב (d_h = 512) שמפיק אמבדינג ביקור קונטקסטואלי. פונקציית המטרה המרכזית היא InfoNCE: לכל POI יש אב-טיפוס ניתן-למידה, והלוס מושך כל אמבדינג ביקור אל האב-טיפוס של ה-POI שלו ודוחף אותו הרחק מאב-טיפוסים של POIs אחרים במיני-באץ'. התוצאה היא צנטרואיד פונקציונלי שממצע לו"זים אישיים של משתמשים שונים.
אתגר הדלילות והפתרון הכפול
הבעיה הקשה היא דלילות: רק 9.07% מה-POIs בלוס אנג'לס ו-7.04% ביוסטון עברו את סף העוגן (anchor threshold) של 100 ו-50 ביקורים בהתאמה. עבור הזנב הארוך, ME-POIs מחשבת גרעינים גאוסיאניים מנורמלים בשלושה רוחבי פס, 0.3 ק"מ, 1.0 ק"מ, 3.0 ק"מ, ומעבירה היסטוגרמות ביקורי עוגן ל-POIs דלילים, עם איבר KL שמכריח את האמבדינג הדליל לחזות את אותו תיעדוף (prior). איבר KL שני מפקח על העוגנים מול התפלגויות אמפיריות משלהם. איבר רביעי ממקסם דמיון קוסינוס עם אמבדינגים טקסטואליים מוקרנים, שהפרומפטים שלהם עוקבים אחרי מתכון GeoLLM: קואורדינטות, קטגוריה, כתובת, ועשרת ה-POIs הקרובים עם מרחק וכיוון.
המספרים: שיפור עקבי, והפתעה בגרסת המוביליות בלבד
ההערכה נערכה על שני דאטה-סטים אנונימיים, לוס אנג'לס (39,557 POIs, 6.9 מיליון ביקורים, שנה מלאה 2019) ויוסטון (28,419 POIs, 715,604 ביקורים, 20 יום במרץ 2020), בחמש משימות העשרת מפה עם בדיקת אמבדינגים קפואים (frozen-embedding probing). התוויות הגיעו מ-SafeGraph לשעות פתיחה וסגירות קבועות, וממפות Google לכוונת ביקור, עומס ורמת מחיר. הוספת ME-POIs שיפרה 34 מתוך 35 צירופי מודל-משימה בלוס אנג'לס. השיפורים היחסיים הבולטים: 16.2% F1 בשעות פתיחה שבועיות (OpenAI-large), 81.9% F1 בכוונת ביקור (Gemini), 6.5% F1 בסגירה קבועה (E5), והפחתה של 24.7% ב-MAE בעומס (Gemini). ביוסטון, F1 של רמת מחיר עלה ב-75.1% עבור GTR-T5. הרגרסיה היחידה: Gemini בסגירה קבועה, ירידה של 0.4%.
הממצא המעניין יותר הוא הגרסה שפותחה על מוביליות בלבד, ללא יישור טקסטואלי כלל. היא הגיעה לדיוק של 0.600 ברמת מחיר בלוס אנג'לס, מול 0.559 של Gemini, התנהגות קולקטיבית שמנצחת את המילים שמשמשות לתיוג המקום. הגרסה הזו גם ניצחה כל בסיס מבוסס-מסלול (trajectory-based baseline) בכל המשימות.
מה צריך כדי להריץ את זה אצלכם
האם זה בר-פריסה (deployable)? חלקית. נכון לפרסום, גוגל שחררה את המאמר אבל לא קוד ציבורי או משקולות, זו מסגרת שבונים מחדש, לא צ'קפוינט שמורידים. החסם החישובי נמוך: המודל מכיל כ-53.7 מיליון פרמטרים ואומן מראש על NVIDIA Tesla V100 16GB בודד. החסם האמיתי הוא דאטה, צריך לוגי ביקורים ברישיון (licensed foot-traffic או first-party visit logs) בתוספת פוליגוני POI. בלי זה, המסגרת נשארת תיאורטית.