21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מוצרים

NVIDIA משיקה את PAIR, נתב הסקה מקומי שמחלק עומסים בין תחנות עבודה

NVIDIA משיקה את PAIR, נתב הסקה מקומי שמחלק עומסים בין תחנות עבודה

הבעיה ש-NVIDIA מנסה לפתור עם PAIR (Personal AI Router) מוכרת לכל מי שמריץ סוכנים מרובי-משימות על חומרה מקומית: סוכן ראשי מפרק משימה לעשרות קריאות מודל עצמאיות, וכולן נתקעות בתור על אותו מנוע הסקה. בזמן שה-GPU שלך מתחמם, ה-DGX Spark בפינת החדר או המקבוק של השותף יושבים סרק. PAIR, שהוכרז השבוע כבטא ציבורית גרסה 0.1.1, הוא נתב וירטואלי שמגלה מכונות תואמות ברשת הביתית ומנתב אליהן בקשות הסקה בודדות, בלי להחליף את מנוע ההסקה עצמו. Ollama או LM Studio עדיין מריצים את המודל על הצומת שנבחר; PAIR רק מחליט לאן לשלוח כל בקשה.

בלי API חדש, פרוקסי לממשקים קיימים

ההחלטה הארכיטקטונית המשמעותית ביותר היא ש-PAIR לא מציג API אשכול (cluster API) חדש. במקום זה הוא פועל כפרוקסי (proxy) לממשקים התואמים-אולמה (Ollama-compatible) ותואמי-LM Studio שהסוכנים כבר מדברים בהם, ותופס את הפורט המוגדר של כל מנוע. אם ה-harness מאזין בפורט אחר, אפשר להגדיר פורט פרוקסי חלופי בהגדרות המנוע של PAIR. המאגר גם חושף נקודות קצה תואמות-OpenAI. התוצאה: סוכנים קיימים לא צריכים שום שינוי קוד, הסוכן מחליט *מה* לבקש, PAIR מחליט *איפה* זה רץ.

גילוי, צימוד ותעבורה מאובטחת

הגילוי מתבצע ב-mDNS אוטומטי, עם אפשרות להוסיף צומת ידנית לפי כתובת IP כשהגילוי נכשל. אמון נוצר דרך PIN בן שש ספרות שמוצג על המכונה המזמינה ומוזן על המוזמנת, כל תקשורת בין צמתים חסומה עד שהצימוד מושלם. אחר כך התעבורה מאובטחת ב-mTLS עם תעודות שנוצרות מקומית. כל צומת מריץ Ollama או LM Studio, ו-PAIR מסוגל להתקין מנוע ולהוריד מודלים על מערכות מצומדות, מה שחוסך את רוב עבודת ההגדרה הידנית בין מכונות.

המתזמן: חמישה אותות, בלי איגום VRAM

צומת נעשה כשיר לבקשה רק כשהמנוע הנדרש מופעל והמודל המבוקש בדיוק נוכח בו. מודלים לא חייבים להיות זהים בכל האשכול, מערכות שונות יכולות להחזיק מודלים שונים, ו-PAIR מנתב לפי מיקום המודל. טעינת אותו תג (tag) על יותר צמתים פשוט מרחיבה את מאגר הזכאים. לכל בקשה המתזמן שוקל חמישה אותות: זמינות הצומת, מנוע נתמך מופעל, נוכחות המודל המדויק, עומס משימות נוכחי על הצומת והמנוע, וניצול GPU קיים. זו מקביליות ברמת עומס-עבודה (workload-level concurrency), והגבול חד: PAIR מקצה כל בקשה לצומת כשיר אחד, שם היא נשארת לכל חייה. הוא לא מאגד VRAM, לא ממזג GPUs למאיץ אחד גדול, ולא משרשר (shard) בקשה בודדת על פני מכונות.

מספרי ההדגמה, עם הסתייגויות

בהדגמה של NVIDIA, PAIR שודך ל-Hermes Desktop שמייצר עומס של חמישה תת-סוכנים על תיבת דואר סינתטית. Ollama הריץ Qwen 3.6 35B A3B על כל צומת שנבחר. על לפטופ RTX Spark בודד העומס לקח 18 דקות בממוצע. על אשכול של שלושה התקנים, לפטופ RTX Spark, DGX Spark ו-RTX 5090, הזמן הממוצע ירד ל-8 דקות ו-48 שניות. המספרים האלה משקפים עומס סינתטי ספציפי אחד; ביצועים בעולם האמיתי תלויים בטופולוגיית הרשת, בהבדלי חומרה ובאופי המודלים.

חומרה נתמכת ודרישות סף

PAIR תומך ב-GeForce RTX סדרה 20 ומעלה, כרטיסי RTX PRO לתחנות עבודה מארכיטקטורת Turing ואילך, DGX Spark, וסיליקון Apple M4 ומעלה. צמתי Windows, Linux ו-macOS יכולים להיצמד זה לזה, על x64 ו-arm64 (Windows על ARM ניסיוני). תצורות מאומתות דורשות 8 גיגה-בייט זיכרון RAM לפחות והמלצה ל-20 גיגה-בייט דיסק. הפצות לינוקס אחרות נבנות מקוד מקור. הקוד המלא זמין ב-GitHub תחת רישיון Apache 2.0, וההתקנים חתומים ל-Windows, macOS ו-Linux.

מקור: marktechpost.com