ג'ינה משחררת מודל OCR קל-משקל עם פענוח ספקולטיבי מובנה

ג'ינה איי-איי (Jina AI), כיום חלק מאלסטיק (Elastic), השיקה את jina-ocr-v1, מפענח מסמכים ויזואלי מקצה לקצה שמקבל PDF, סריקות, טבלאות, תרשימים או חשבוניות ומחזיר מארקדאון (Markdown) נקי במעבר יחיד. המודל מכיל 3.4 מיליארד פרמטרים בסך הכול, אך רק כ-570 מיליון פרמטרים פעילים בכל טוקן בזכות ארכיטקטורת MoE, והוא תוכנן לרוץ על כרטיסים זולים יחסית כמו NVIDIA L4. בדו"ח הטכני מדווחים 91.14 ב-OmniDocBench גרסה 1.6 ו-83.4 ב-olmOCR-Bench, אלא שהדיוק אינו ההישג המרכזי כאן: התפוקה היא הסיפור.
ארכיטקטורה רזה עם מקודד דחוס
המודל מבוסס על DeepSeek-OCR ושומר על שני רכיבי היעילות שלו. המקודד (DeepEncoder), כ-380 מיליון פרמטרים, משרשר את SAM, מדחס קונבולוציוני פי-16 ו-CLIP-L, והופך תצוגת עמוד 1024×1024 מ-4,096 טלאים (patches) ל-256 טוקנים ויזואליים בלבד. מצב רזולוציה דינמי מוסיף עד תשע אריחים מקומיים בני 100 טוקנים כל אחד, כך שעמוד מוגבל ל-1,156 טוקנים ויזואליים מקסימום. המפענח (decoder) הוא DeepSeek-3B-MoE עם 12 שכבות, 64 מומחים מנותבים ושני מומחים משותפים; ניתוב Top-6 מפעיל כ-570 מיליון פרמטרים לטוקן, ומגבלת המיקום עומדת על 32,768. הפלט מוחזר כמארקדאון, טבלאות ב-HTML ונוסחאות ב-LaTeX.
פענוח ספקולטיבי ללא אובדן דיוק
היתרון התחרותי מגיע מ-FastMTP, ראש פענוח ספקולטיבי שמגיע בתוך הצ'קפוינט עצמו. מכיוון שפלט OCR הוא כמעט דטרמיניסטי ומבנה מקומי, הוא מתאים במיוחד לגישה הזו. הראש מוסיף בלוק טיוטה דחוס אחד שמופעל רקורסיבית ל-K=3 צעדים; פרמטרי הטיוטה נשארים קבועים כשהעומק גדל. המפענח מאמת את הטיוטות בחמדנות, מקבל את הקידומת הארוכה ביותר שתואמת את בחירותיו שלו, ומתחייב על טוקן נוסף משלו. אם כל שלוש הטיוטות תואמות, הטוקן הנוסף הוא בונוס. הטקסט המתחייב תמיד זהה לפענוח חמדני רגיל, כך שההאצה היא ללא אובדן (lossless). ב-K=3 המודל מתחייב בממוצע על 2.73 טוקנים לצעד.
אימון-אחר עם תגמולים ניתנים-לאימות
אימון-ההמשך משלב יישור הוראות, כוונון עמידות על עמודים מושחתים ו-GRPO. כל מרכיב תגמול הוא קוד דטרמיניסטי שמקבל ניקוד מול תעתיק ייחוס, והמרכיבים מכסים תוכן, נוסחאות, טבלאות, תקינות מבנית, בדיקות יחידה, חזרתיות ופורמט. המרכיבים מוכפלים זה בזה, וכל אחד מדורג בנפרד, כך שעמודים נכונים-חלקית מקבלים קרדיט חלקי. מרכיבי מבנה, בדיקות יחידה ופורמט מקבלים רצפה של 0.2, מרכיב הטבלאות רצפה של 0.1, ומרכיב החזרתיות ללא רצפה, כי לולאות עלולות לנפח את ציון התוכן. מכיוון שבעמודים טבעיים נוסחאות וטבלאות מופיעות בדגימות מעטות, ג'ינה בנתה את JinaOCRSynth, עמודים סינתטיים דחוסים בשניהם, כל אחד נושא בדיקות יחידה בסגנון olmOCR-Bench. סוכן (agent) גם ממזג צ'קפוינטים מועמדים תחת תקציב הערכה קבוע, וראש הטיוטה מאומן אחרון מול המאמת הסופי הקפוא.
תפוקה גבוהה על חומרה זולה
בבדיקות התפוקה התמונה מתהפכת. על A100 40 ג'יגה-בייט בריבוי משימות (concurrency) של 32, jina-ocr-v1 מעבד 2.57 עמודים לשנייה, הגבוה ביותר מבין 14 מערכות שג'ינה מדדה, מול 1.22 של olmOCR-2 ו-0.38 של chandra-ocr-2. המודל פולט 1,085 טוקני פלט לעמוד, שלדברי ג'ינה הוא הפלט הקצר ביותר בקרב מערכות שעברו ציון 83. על L4 בגודל אצווה 1, פענוח חמדני (eager) קופץ מ-42.7 ל-83.1 טוקנים לשנייה, האצה של פי 1.95 בשיעור קבלה של 57.6%. עם גרפי CUDA הבסיס כבר עומד על 158.3 טוקנים לשנייה, ושם K=1 מנצח עם 185.6 טוקנים לשנייה, רווח של פי 1.17 בלבד.
רישיון ומסלולי הרצה
המשקלים הפתוחים שוקלים כ-6.8 ג'יגה-בייט ב-BF16 ורצים על Transformers או vLLM. הרישיון הוא CC BY-NC 4.0, שימוש מסחרי מחייב פנייה לג'ינה. המסלול המהיר ביותר הוא Jina Reader: שליחת כתובת URL אל r.jina.ai עם הפרמטר המתאים. לחלופין, אפשר לטעון את המודל מקומית דרך הספריות הסטנדרטיות.