22 בספטמבר 2026 האקדמיה ארכיון
מבזקים
White Circle משיקה את Halo, פריימוורק אימון בקוד פתוח שמבטיח 2.8x תפוקה על B300 vLLM מעבירה פענוח וידאו ל-NVDEC ומכפילה תפוקה ב-8×H100 מונשוט משיקה את קימי K3 על בדרוק עם חלון הקשר של מיליון טוקן מצרים עוברת משלב הפוטנציאל לייצור בפועל: אירוע אקוסיסטם במוזיאון המצרי הגדול סימן קפיצת מדרגה NVIDIA חותכת את תעבורת הטוקנים של סוכני קוד בחצי עם SoL-Pi
מוצרים

AWS משיקה את Strands Harness, רתמת סוכנים פתוחה שחוסכת 28% בעלויות טוקן

AWS משיקה את Strands Harness, רתמת סוכנים פתוחה שחוסכת 28% בעלויות טוקן

צוות Strands Agents של AWS שחרר את Strands Harness, רתמת סוכנים (agent harness) בקוד פתוח תחת רישיון Apache 2.0, שמיועדת לסגור את הפער בין אב-טיפוס שעובד ב-Claude Code או Codex לבין גרסה שרצה בלופ עצמאי. החבילה זמינה ל-Python ול-TypeScript, עולה לאוויר בשורת קוד אחת, ומאפשרת הרצה מקומית או דיפלוי לענן, כולל קובץ סקילס שמייצר קונפיגורציה ל-AWS, GCP, Azure, Cloudflare ו-Modal.

מה זה בכלל רתמה ולמה זה משנה

רתמה היא המעטפת שסביב המודל: הלופ, הכלים, ניהול הקונטקסט, זיכרון ומנגנוני התאוששות. עד עכשיו ה-SDK של Strands חשף את אבני הבניין האלה בנפרד; Strands Harness אורז אותן לברירות מחדל עובדות. ה-`create_harness` מחזיר סוכן כללי (לא סוכן קוד ייעודי) שרץ על מודלי חשיבה עדכניים דרך Bedrock, Anthropic, OpenAI, Google, Ollama או LiteLLM, ומגיע עם כלי shell, קבצים (קריאה, כתיבה, עריכה) וכלי ווב, במקום כלי ייעודי לכל משימה. תוצאות כבדות של כלים נפרקות לקבצים, חלקים חוזרים של הבקשה נשמרים בקאש, זיכרון ארוך-טווח נשמר בין ריצות, וסשן ניתן לחידוש לפי מזהה. סוכן עזר מובנה מקבל תת-משימות פתוחות, וצ'קליסט עוקב אחרי עבודה מרובת-שלבים.

הבנצ'מרקים וה-28%, עם כוכבית חשובה

הצוות הריץ בנצ'מרקינג מבוזר על EC2 עם Harbor, פריימוורק ההערכה של יוצרי Terminal-Bench. הציון הוא ממוצע על פני שישה בנצ'מרקים: ALFWorld, ContextBench, GAIA, WebShop, τ²-bench ו-Terminal-Bench 2.1. העלות נמדדה בדולרים ממוצעים למשימה. המתחרים בגרף: Claude Code, Codex, oh-my-pi, OpenCode ו-DeepSeek Harness. הנתון הבולט, 28% חיסכון בטוקנים בדיוק דומה, מגיע עם סייג: DeepSeek Harness היה היעיל ביותר טוקניסטית, זול בכ-14% מ-Strands Harness, אבל השיג ציון נמוך יותר בכל בנצ'מרק. ההערה בתחתית הגרף מציינת שהכללתו הורידה את נתון החיסכון הכולל ל-28%. הנקודה הגבוהה בגרף היא Claude Opus 5 על Strands Harness, סביב 85% הצלחה.

ראש בראש ב-Terminal-Bench 2.1

ההשוואה הנקייה ביותר משתמשת ב-Claude Fable 5 על Terminal-Bench 2.1 עם 89 הרצות לכל רתמה. מול Claude Code, Strands Harness עלה 77% פחות והשיג 7.9 נקודות יותר. oh-my-pi הגיע לאותה רמת דיוק (69.7) בעלות גבוהה ב-54%. DeepSeek Harness היה זול עוד יותר, אבל פיגר ב-10.2 נקודות. הצוות מציין ששתי רתמות קוד פתוח נוספות הציגו ביצועי עלות-דיוק טובים מול Claude Code.

מה דוחף את היעילות, ניהול קונטקסט בשלושה כללים

Strands Harness מגיע עם ברירות מחדל ל-prompt caching ולניהול קונטקסט. החוקרים אומרים שניהול הקונטקסט הוא הגורם העיקרי גם ליעילות הטוקנים וגם לדיוק. שלושה כללים עושים את העבודה: תוצאות כלים מעל ~1,500 טוקנים נחתכות; סיכום (compaction) מופעל כשהשימוש בקונטקסט עובר 85%; והתאוששות קונטקסט רצה בתוך הלופ אם החלון עולה על גדותיו. זה תואם מחקר עצמאי עדכני: מחקר HarnessTax השווה את Claude Code, Codex CLI ו-Pi על פני שבעה מודלים, ומצא שבחירת הרתמה כמעט לא הזיזה את שיעורי ההצלחה, בעוד אותו מודל הגיע להצלחה דומה בעד פי 5 הבדל בעלות. חוקרי Strands מדווחים שמאמר המשך על הבנצ'מרקים שלהם בדרך.

איך מתחילים

התקנה: `pip install strands-harness` או `npm install @strands-agents/harness`. בוחרים מודל בשם, או מפנים את הרתמה למודל מקומי ב-Ollama:

from strands_harness import create_harness
agent = create_harness(model="litellm/openai/gpt-5.6-sol")
agent("Research the top three vector databases and compare their pricing")

ה-CLI של Strands (npm install...) מאפשר הפעלה מהירה מהטרמינל.

מקור: marktechpost.com