מֶטָה מְשַׁגֶּרֶת מוֹדֵל שֶׁמְּחַלֵּט אֵילוּ נִסּוּיִים שָׁוִים זְמַן GPU

צְוַת מְחַקֵּר מ-FAIR בְּמֶטָה, אוֹקְסְפוֹרְד וְיוּסִי אֶל בָּנָה מַעֲרֶכֶת שֶׁמְּדַרֶּגֶת נִסּוּיִים שֶׁעֲדַיִן לֹא רָצוּ, וְחוֹסֶכֶת כְּשָׁלוֹשׁ שָׁעוֹת מִכָּל יוֹם חִשּׁוּב. הַבְּעָיָה שֶׁהֵם פּוֹתְרִים מֻכֶּרֶת לְכָל מִי שֶׁהֵרִיץ סוֹכֵן מֶחְקָר: הַסּוֹכֵן מְיַצֵּר עֲשָׂרוֹת מֻעֲמָדִים, אֲבָל כָּל הַרְצָה אוֹכֶלֶת שָׁעוֹת עַד יָמִים שֶׁל H100 אוֹ H200. הַבַּקָּשָׁה לִיצִירָה זֹלָה, הָאִמּוּת יָקָר, וְהַבְּחִירָה מָה לְהָרִיץ הִיא הַמַּנּוֹף הָאֲמִתִּי עַל קֶצֶב הַהִתְקַדְּמוּת.
אֵיךְ הַמּוֹדֵל יוֹשֵׁב בַּלּוּלָאָה
הַמַּעֲרֶכֶת, שֶׁקִּבְּלָה אֶת הַשֵּׁם Research Preference Models (RPMs), מִשְׁתַּלֶּבֶת בְּסַבִּיבַת AIRA-dojo, חִפּוּשׂ עֵץ אֶבּוֹלוּצִיּוֹנִי שֶׁמְּיַצֵּר יְלָדִים בְּשָׁלֹשׁ פְּעֻלּוֹת: Draft, Improve, Debug. בִּמְקוֹם לְהָרִיץ יֶלֶד אֶחָד וּלְקַוּוֹת לְטוֹב, הַסּוֹכֵן מַפְעִיל אֶת הָאוֹפֵּרָטוֹר 15 פְּעָמִים בְּמַקְבִּיל, מְקַבֵּל 15 מֻעֲמָדִים שֶׁלֹּא בּוּצְּעוּ, וּמַשְׁוֶה אוֹתָם בְּטוּרְנִיר נוֹקְאוֹאוּט זֻגִּי. רַק הַמְּנַצֵּחַ מְגִיעַ לְבִצּוּעַ. כָּל הַשְׁוָאָה מִתְבַּסֶּסֶת עַל צְמָדִים שֶׁנֶּאֶסְפוּ בְּסְרִיקַת BFS שֶׁל הָעֵץ, כְּשֶׁכָּל צֶמֶד מוֹפִיעַ עִם הַצִּיּוּן שֶׁהִשִּׂיג בְּוָלִידַצְיָה.
שְׁתֵּי גִּרְסָאוֹת, שְׁנֵי תַּקְצִיבִים
הַגִּרְסָה הָרִאשׁוֹנָה, Inference-only, הִיא LLM-as-a-judge שֶׁמְּקַבֵּל תּוֹכְנִיּוֹת, קוֹד וְהִיסְטוֹרְיַת חִפּוּשׂ. הַפְּרוֹמְפְּט עָבַר אופְטִימִיזַצְיָה עִם MIPROv2 מ-DSPy וְהִתְכַּנֵּס לְרוּבְּרִיקָה שֶׁל מְנַהֵל מַעְבָּדָה: סוֹבֵל בָּאגִים בְּרֵי-תִקּוּן, מְתַגְמֵל הַרְחִיבוּת, מַעֲנִישׁ כִּפְלוּת. דִּיּוּק אופְלַיְן 57.7%-59.0%. הַגִּרְסָה הַשְּׁנִיָּה, Agentic, מוֹסִיפָה סֶנְדְּבּוֹקְס שֶׁמְּשַׁכְפֵּל אֶת הַסְּבִיבָה עִם H200 בּוֹדֵד, מְרִיצָה נִסּוּיֵי טַיִּס קְטַנִּים, וּמְקַבֶּלֶת הַחְלָטָה אִם לְהַמְשִׁיךְ אוֹ לַעֲצֹר. שְׁתֵּי הַחְלָטוֹת עִקְרִיּוֹת כָּאן: הַתַּקְצִיב הַנּוֹתָר מְדֻוָּח בְּהַגְזָמָה (2,700 שְׁנִיּוֹת נֶגֶד 300 בֶּאֱמֶת) כְּדֵי שֶׁהַסּוֹכֵן לֹא יַעֲצֹר מֻקְדָּם, וְהַטַּיָּסִים מֻגְבָּלִים ל-30 עִם סַף שֶׁל 60 שְׁנִיּוֹת. זְמַן הַטַּיָּס מִתְחָרֶה בַּשָּׁעוֹן שֶׁל הַסּוֹכֵן עַצְמוֹ, לָכֵן הַבּוֹחֵר הָאָגֶ'נְטִי רָץ רַק בְּDraft וְImprove; בְּDebug חוֹזְרִים לִבְחִירָה אַקְרָאִית.
מַסְפְּרִים שֶׁמְּדַבְּרִים בְּעַד עַצְמָם
הַבֶּנְצְ'מַרְק AIRS-Bench כָּלַל 20 מִשִּׂימוֹת טֶקְסְט וְטַבְּלָאוֹת, 24 שָׁעוֹת עַל H200 בּוֹדֵד לְמִשִּׂימָה, 10 זְרָעִים, Qwen3.6-27B כְּשִׁדְרָה לִשְׁנֵי הָאוֹפֵּרָטוֹרִים וְלַ-RPM, כָּךְ שֶׁהַרוֹוַח בָּא רַק מִשְּׁכֶבֶת הַבְּחִירָה. הַסְתַּבְּרוּת לְשִׁפּוּר מוּל בְּלִי-RPM עָמְדָה עַל 0.5923 וְ-0.5913, עִם גְּבוּל תַּחְתּוֹן שֶׁל 95% CI בְּ-0.5066 וְ-0.5018. אֲבָל הַיְּעִילוּת הִיא הַתּוֹצָאָה הַמַּעֲשִׂית: Inference-only הִגִּיעַ לְצִיּוּן הַסּוֹף שֶׁל הַבֵּייסְלַיְן (0.684) בְּ-14.88 שָׁעוֹת (פִּי 1.61), Agentic בְּ-15.50 שָׁעוֹת (פִּי 1.55). הִסְקָה בְּאִירוּחַ עַצְמִי מוֹסִיפָה 0.66 שָׁעָה לְהַרְצָה; אַחֲרֵי הַתְאָמָה עֲדַיִן מְקַבְּלִים 0.708 בְּ-23.34 שָׁעוֹת. שְׁתֵּי תּוֹצְאוֹת SOTA חֲדָשׁוֹת דֻּוְּחוּ: WinoGrande 94.1% עִם Agentic RPM נֶגֶד 90.4% שֶׁל AIRA₂, וְ-SVAMP 95.7% עִם Inference-only נֶגֶד 94.2% שֶׁל בְּנֵי אָדָם.
קוֹד פָּתוּחַ, לְלֹא פַיְן-טְיוּנִינְג
שְׁתֵּי הַגִּרְסָאוֹת רָצוֹת עַל LLM קְפוּאִים לְלֹא כָּל fine-tuning. הַשִּׁדְרָה Qwen3.6-27B הִיא open weights, וְגַם הַסַּקְפוֹלְד AIRA-dojo וְהַבֶּנְצְ'מַרְק AIRS-Bench פּוּרְסְמוּ בְּקוד פָּתוּחַ. זֶה אוֹמֵר שֶׁכָּל צֶוֶת שֶׁמֵּרִיץ סוֹכְנֵי מֶחְקָר יָכוֹל לְהַלְבִּישׁ אֶת שְׁכֶבֶת הַבְּחִירָה הַזֹּאת מֵעַל הַקַּיָּם, בְּלִי לְאַמֵּן מוֹדֵל חָדָשׁ, בְּלִי לְשַׁלֵּם עַל מִשְׁקָלוֹת קְנִיָּנִיִּים.