13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
נווידיה משקיעה 500 מיליארד דולר: הבטוחה של מרכזי הנתונים ל-AI ה-FT פרסם ב-13 באוגוסט 2026 מאמר על האפשרות של EY להיות המפקחת של Anthropic מודל 2-ביט של NVIDIA Nemotron 3.5 Lightning מריץ קריאות כלי במשך 10 דקות עם 22 GB VRAM אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים
מוצרים

שיאומי משיקה מדדים חדשים להערכת מחיקת אובייקטים בווידאו, בלי רפרנס

מאת הדר מזרחי כתב/ת AgentNet
שיאומי משיקה מדדים חדשים להערכת מחיקת אובייקטים בווידאו, בלי רפרנס

צוות MiLM Plus של שיאומי שחרר את PROVE, סוויטת הערכה שמנסה לסגור את הפער בין איכות ויזואלית אמיתית של מודלי מחיקה לבין מה שהמדדים הקיימים מודדים. הבעיה מוכרת: מודלי דיפוזיה כבר יודעים לשחזר צללים, השתקפויות ומבנים מוסתרים בצורה משכנעת, אבל PSNR, SSIM, LPIPS, ReMOVE ו-CFD מדרגים את הפלטים שלהם הפוך. הסיבה מבנית, מחיקה היא משימה לא מוגדרת היטב (ill-posed) עם פתרונות רבים לאותו חור, אז אין ground truth יחיד להשוואה. PROVE, שהתקבל ל-ACM MM 2026, מציע שני מדדים תפיסתיים, RC-S לקוהרנטיות מרחבית ו-RC-T לעקביות זמנית, יחד עם PROVE-Bench, בנצ'מרק וידאו דו-שכבתי מהעולם האמיתי. שניהם פועלים מקומית על אזור העריכה, בלי להזדקק לווידאו רפרנס.

למה המדדים הישנים נכשלים

החוקרים מתעדים שלושה מצבי כשל שיטתיים. הטיה של full-reference: PSNR, SSIM ו-LPIPS מניחים התאמה נקודה-לנקודה, אז הם מתגמלים copy-paste על פני מחיקה אמיתית; צללים שנשארו תופסים מעט פיקסלים וכמעט לא נענשים. גרוע מזה, קיצוץ שלבי אינפרנס בדיפוזיה משפר PSNR ו-SSIM בזמן שהאיכות הוויזואלית קורסת, רגרסיה לממוצע. עיוורון no-reference: על ROSE-Bench, כשמטשטשים בהדרגה את האזור המסומן, לא ReMOVE ולא CFD מתדרדרים; שניהם בסוף עוברים את הבסיס הלא-מטושטש. המרכיב מבוסס-SAM של CFD גם מתריע שווא: מושב אופניים ששוחזר כהלכה מסומן כהלוצינציה ומקבל ציון גרוע יותר מהקלט המקורי. חוסר רגישות זמנית: מדדי Temporal Consistency ו-Temporal Flickering עובדים על פיצ'רים של פריים מלא; מכיוון שהאזור הערוך הוא שבריר מהפריים, הזרקת השחתות Random Drop ו-Random Replace על DAVIS בקושי מזיזה אותם, ולפעמים בכיוון ההפוך.

איך RC-S ו-RC-T עובדים

שני המדדים חולקים רעיון מרכזי: התאמת התפלגות במרחב פיצ'רים עמוק במקום אגרגציה גלובלית. RC-S (מרחבי) מפעיל connected-component analysis כדי לפצל את המסכה למטרות עצמאיות. כל תיבת תוחם מורחבת בשליש מאורך הצלע, החיתוך עובר דרך DINOv2, והמסכה מדוגמת-מחדש לרזולוציית הפיצ'רים. חלון w×w מחליק על מפת הפיצ'רים ומחשב Maximum Mean Discrepancy בריבוע עם גרעין RBF גאוסיאני בין פיצ'רים במסכה לפיצ'רי רקע מקומיים. הציונים ממוצעים פר מטרה ואז כלל המטרות. RC-T (זמני) גוזר פריימים סמוכים במשותף תחת איחוד המסכות שלהם כדי למנוע misalignment, ואז מפעיל MMD באותו אופן על הציר הזמני.

פריסה: כלי CI, לא פיצ'ר מוצר

PROVE מגיע כ-repo פייתורץ' ברישיון Apache 2.0 עם נקודת כניסה CLI יחידה (run_prove_metrics.py). דרישות: פייתון 3.10+, פייתורץ' 2.6+, טרנספורמרים 4.51+, ומשקולות DINOv2-giant. מסכות חובה, פיקסלים לבנים מסמנים את האובייקט שנמחק. RC-S רץ ב-134.6 מילישניות לפריים על RTX 4090 בודד, מה שהופך שערי CI ליליים למעשיים גם לסטארטאפים; ארגונים עם קטלוגי עריכה גדולים מרוויחים הכי הרבה, כי אין צורך ב-ground truth מזווג. ייעוד: בייק-אופים של מודלים, שערי CI על RC-S/RC-T, כוונון שלבי אינפרנס או קוונטיזציה בלי רפרנס, סינון דאטה אימון, ועיצוב reward models. לא מתאים: ניקוד בזמן אמת על-מכשיר, ותופעות לוואי כמו צללים או השתקפויות גדולות שגולשות מעבר לאזור ההערכה החתוך.

למי זה מיועד, ואיפה זה לא

קהל היעד הראשון: חוקרי ראייה ממוחשבת ומהנדסי AI/ML יישומיים בצוותי עריכה; שני: מהנדסי MLOps שמחברים את הציון ל-CI; שלישי: מנהלי מוצר שמריצים השוואות ספקים. תעשיות רלוונטיות: אפליקציות גלריה ומצלמה בסמארטפונים, עריכת סרטונים קצרים, ניקוי קטלוגי איקומרס, פרסום ומאגרי מדיה, פוסט-פרודקשן קולנוע/VFX, הדמיית נדל״ן, והסתרת פרטיות בארכיוני מיפוי. שלושת מצבי הכישלון המתועדים נשארים רלוונטיים: המשימה נותרת ill-posed ו-one-to-many, אז אין פתרון יחיד נכון, PROVE רק נותן סרגל שמדבר בשפה של תפיסה אנושית במקום בפיקסלים.

מקור: marktechpost.com