21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

ספריית HumanEvals יוצאת לדרך: שיפוט אנושי אמיתי בתוך לולאת ההערכה

ספריית HumanEvals יוצאת לדרך: שיפוט אנושי אמיתי בתוך לולאת ההערכה

ספריית קוד פתוח חדשה בשם HumanEvals מאפשרת למפתחי מודלים לשלב שיפוט אנושי חי בתוך תהליך ההערכה האוטומטי שלהם, בלי לעזוב את ה-notebook ובלי לבנות תשתית איסוף תגובות מאפס. הספרייה, שפותחה על ידי צוות Datapoint, עוטפת את ה-API של פלטפורמת התיוג שלהם ומחזירה אובייקטי Score תואמי autoevals, כך שהקוד הקיים שמריץ בנצ'מרקים אוטומטיים יכול לעבוד עם מצביעים אנושיים בלי שכתוב.

המנוע מאחורי הקלעים: 5,000 תיוגים בדקה

הכוח האמיתי יושב ב-Datapoint עצמה: אותה בריכת מתייגים שמעבדות מודלי תמונה, אודיו ווידאו מובילות כדי להשוות צ'קפוינטים מול מתחרים. לפי נתוני החברה, הקיבולת עומדת על יותר מ-5,000 תיוגים בדקה, והספרייה תומכת בארבעה מצבי הערכה, השוואה זוגית (pairwise), דירוג בסולם קבוע, בחירה מרובה (כולל סיווג מול תשובה צפויה), ודירוג יחסי של כמה מועמדים. כל מצב מקבל פרומפט חופשי ופריטי קלט, טקסט, קבצי מדיה מקומיים שעולים אוטומטית, או אובייקטי בחירה/דירוג מובנים, ומחזיר ציון בטווח [0, 1] עם מטא-דאטה מלא: ספירות הצבעה גולמיות, מדדי הסכמה, גרסאות משוקללות אמון, וה-job_id למעקב.

ארגז חול חינמי לפיתוח, תשלום רק בייצור

לכל סקורר יש פרמטר `sandbox=True` שמריץ את המשימה על בריכת הבדיקה של Datapoint, אפס קרדיטים, מתייגי מבחן, מכניקת API זהה. זה מאפשר לחבר את הצנרת מקצה לקצה לפני שמשלמים על תיוג אמיתי. בקריאות אצווה (`eval_batch`) נוצר Job יחיד לכל הפריטים, והמתייגים עובדים במקביל: קהל רחב מסיים בדקות, טירגוט צר יכול לקחת שעות. למשימות ארוכות הספרייה חושפת `submit()` שמחזיר job_id, ואז `EvalJob.attach()` שמאפשר לחזור מאוחר יותר, אפילו מתהליך אחר, לבדוק התקדמות חיה, להציץ בתוצאות חלקיות עם `wait=False`, או לבטל ולקבל החזר על הרזרבה הלא מנוצלת.

תאימות autoevals והחלפת שופטי LLM

ממשק ה-HumanComparison תומך גם בקריאה בודדת בסגנון autoevals, `scorer(output=..., expected=..., input=...)`, שמחזירה את ההסתברות שבני אדם יעדיפו את הפלט, ישירות להשוואה מול Battle של autoevals. זה פותח דלת לכיול שופטי LLM מול קרקע-אמת אנושית, בניית דאטה-סטים זהובים מקונצנזוס, ואיסוף העדפות ל-RLHF עם גישה לתגובות פר-מתייג ולא רק לממוצעים. התלות היחידה בזמן ריצה היא `httpx`, והספרייה דורשת Python 3.10 ומעלה.

מה זה משנה בפועל לצוותי מחקר

עד היום, שילוב שיפוט אנושי בפייפליין אימון הצריך לבנות דשבורד פנימי, לגייס מתייגים, לנהל תורים ולחשב הסכמות, או לקנות שירות מנוהל בלי שליטה על הלוגיקה. HumanEvals דוחפת את כל זה לספרייה אחת שמדברת את אותה שפה של הבנצ'מרקים האוטומטיים. התוצאה: חוקרים יכולים להריץ הערכה אנושית על צ'קפוינט כל לילה, להשוות ראש-בראש מול מודל מתחרה, ולקבל החלטת שחרור מבוססת נתונים, בלי לצאת מה-CLI.