מודל שפה מצייר בצבעי מים דרך קוד ג'אווה-סקריפט, והכול פתוח להרצה

סוריה נארדי (Surya Narreddi) העלה ב-23 באוגוסט סרטון של ציורי צבעי-מים שנוצרו על ידי מודל שפה, והקליפ צבר יותר מ-1.5 מיליון צפיות בתוך ימים. המודל לא מייצר פיקסלים ישירות, הוא כותב תוכנית ג'אווה-סקריפט של כ-150 שורות שמריצה את ספריית p5.brush, שמוסיפה כלי ציור טבעיים ל-p5.js. הפלט הוא קוד קריא, ניתן לעריכה והרצה חוזרת, וכל החלטת מכחול גלויה בו. כעת מפתח נוסף משחזר את המתכון במלואו בקוד פתוח, עם שלושה מיקסי תגמול שונים שהושוו זה לזה, וכל הארטיפקטים זמינים ב-Hugging Face.
הרקע: מרעיון אמנותי לסביבת RL
לדברי נארדי, הדרך לפרויקט התחילה בפרומפטים למודלי טקסט-לתמונה, שם הפרומפט הוא המנוף היחיד ושליטה נוספת מושגת רק עד גבול מסוים. אימון המודל עצמו מרחיק לכת יותר. החצי השני של הרעיון הוא המדיום: המודל מוגבל לעשר שיטות בלבד מתוך הספרייה, והמגבלה הזו מייצרת את הסגנון האופייני, רפוי, לא מושלם, בעל מראה ידני. נארדי פרסם פוסט טכני על שלב מוקדם וצר יותר של הפרויקט (פרחים בקלוז-אפ), והבטיח דוח טכני מלא. המשחזר הלך בעקבות הפוסט צעד אחר צעד, ושינה רק מה שנדרש הכרחית; כל רעיון עצמאי נרשם ברשימת "מה הייתי מנסה הלאה" במקום להיכנס לניסוי.
המימוש הפתוח: צנרת שלמה על Hugging Face
השחזור רץ מקצה לקצה על Hugging Face: אימון על Jobs, סביבת RL ומודל ניקוד כ-Spaces, שופט זוגי דרך Inference Providers, וכל הארטיפקטים מרוכזים באוסף אחד ב-Hub. אחרי ששני ה-Spaces עולים, ההרצה היא פקודה אחת, משכפלים את הסביבה ואת מודל הניקוד, קובעים שני משתני סביבה למיקס התגמול, ומפעילים את סקריפט האימון `watercolour_grpo.py` עם פרמטרים קבועים (Qwen3.5-35B-A3B עם LoRA, bf16, gradient checkpointing, 110 צעדים, 240 אפיזודות, 8 דורות לכל צעד, אורך השלמה עד 8192 טוקנים). המודל המאומן נדחף אוטומטית ל-Hub.
שלושה מיקסי תגמול והשוואה ראשונית
החידוד המרכזי בגרסה הפתוחה הוא השוואה שיטתית של שלושה מיקסי תגמול (reward mixes) שונים, לצד מאגר דירוג ידני (hand-rated pool) שנבנה לטובת הניסוי. שלושת הריצות פורסמו במלואן, כולל כל ציור שנוצר בכל ריצה, כך שאפשר לבחון לא רק מדדים כמותיים אלא גם את האיכות החזותית בפועל. המחבר מדגיש שהמספרים לבדם לא מספרים את הסיפור המלא; הפער בין תמונות "מושלמות סטטיסטית" של מודלי תמונה לבין המראה הידני, הלא-מלוטש כאן, הוא חלק ממה שהפך את הסרטון המקורי לוויראלי.
הקשר היסטורי: חזרה לימי ה-GAN המוקדמים
הפרויקט מזכיר את הימים הראשונים של אמנות AI גנרטיבית, DeepDream מ-2015 שנולד ככלי דיבאג והפך לכלי יצירה, "אדמונד דה בלאמי" מ-2018 שיצא מחקירת GANs, ועבודות של מריו קלינגמן (Mario Klingemann) שיצר דיוקנאות חלומיים ברשתות נוירונים. אז, כמו היום, העניין לא היה בשלמות טכנית אלא בחקירת המדיום. ההבדל: כאן המודל כותב קוד מצייר, לא פיקסלים, והקוד עצמו הוא היצירה, שקוף, ניתן לביקורת, ניתן להמשך.
מה הלאה: רשימה פתוחה במקום ניחושים
כל הארטיפקטים, דאטסט הרפרנס, סביבת RL, סקריפטי אימון, מודלים מאומנים, שלושת הריצות וכל ציור, זמינים ב-repo ובאוסף ב-Hub. רשימת "מה הייתי מנסה הלאה" פורסמה לצד הארטיפקטים, ומזמינה את הקהילה להמשיך מהנקודה שבה נעצר השחזור. אין כאן הבטחות לפריצת דרך, רק צנרת פתוחה שאפשר להריץ, לבדוק ולהרחיב, בדיוק כמו בימים שבהם הקוד היה חשוב יותר מההייפ.