
מועדון קריאת מסמכים של שכבת הלימוד - שבוע 33 - SlopCodeBench
תיאור
המאמר של השבוע:SlopCodeBench: השוואה כיצד סוכני קוד מתדרדרים במהלך משימות איטרטיביות באורך ארוך קישור: https://arxiv.org/abs/2603.24755אתר: https://www.scbench.ai/קוד: https://github.com/SprocketLab/slop-code-bench תקציר: כמעט כל תחום benchmark קידוד מבקש מסוכן לפתור בעיה פעם אחת, מההתחלה. תוכנה אמיתית איננה נבנית כך - היא מורחבת, שוב ושוב, על ידי מישהו שעובד על קוד שכבר קיים. סטאפ חד פעמי מסתיר את מה שפרקטיקנים באמת דואגים לו: לא האם סוכן יכול לעבור מבחן היום, אלא איך הקוד שלו נראה לאחר עשרים סיבובים של "עכשיו גם לטפל בזה." SlopCodeBench מודד את זה. זהו benchmark של 36 בעיות ו-196 צמתים שבהן סוכן מרחיב שוב ושוב את הפתרון הקודם שלו עם הגעת דרישות חדשות. המפרטים מתארים במכוון רק התנהגות חיצונית - חוזה CLI או API - ואינם אומרים דבר על ארכיטקטורה, חתימות פונקציה או גבולות מודול, כך שהחלטות עיצוב מוקדמות הן רק של הסוכן ומתרקמות לאורך הריצה. חבילת המבחנים נשמרת מוסתרת כך שהיא לא יכולה לדלוף רמזים מבניים. לצד נכונות, המחברים עוקבים אחרי שני סוגים של התדרדרות: שחיקה מבנית (ריכוז מורכבות בפונקציות שכבר מורכבות) ודיבורנות (צמיחה של קוד מיותר ומועתק). התוצאות עגומות. בקרב 15 סוכני קידוד פתוחים וסגורים, אף אחד לא פותר לחלוטין בעיה אחת מתחילה ועד סוף, והטוב ביותר עובר 14.8% מהצמתים. האיכות יורדת ככל שהמסלולים מתארכים: שחיקה מבנית עולה ב-77% מהמרוצים ודיבורנות ב-75.5%. ההשוואה שנותנת למאמר את שמו: בהשוואה ל-473 מאגרי Python קוד פתוחים, קוד הסוכן הוא 2.3x יותר דיבורני ו-2.0x יותר משחוק, ומאגרי בני אדם מתדרדרים פחות פעמים ובמרווחים קטנים יותר לאורך היסטוריות ה-git שלהם. לאמר לסוכן לכתוב קוד נקי מפחית את הדיבורנות והשחיקה הראשוניים עד שליש - אך אינו משפיע על שיעור השחיקה. חשוב לכל מי ששולח קוד כאשר סוכן מעורב, ולעבור מי שחושב כיצד להעריך התנהגות סוכנת באורך ארוך. אין צורך בהכנה - בואו לקרוא ולדון איתנו. ג'ייסון קרבר יציג את המאמר השבוע מהו מועדון קריאת מסמכים של מעבדות שכבת הלימוד? יוזמה מ-https://www.learninglayer.ai, מעבדה שהמטרה שלה היא להפחית חרדת AI בעולם. מהו הפורמט? מבוסס דיון. צפו בסביבה עם לחץ נמוך לשיתוף תובנות ודעות עם הקבוצה. מהן המטרות של הקבוצה? להישאר מעודכנים על מחקרי AI ולשפר הבנה של יסודות + מתמטיקה של AI. מי מוזמן? כולם! נסו להקדיש לפחות קצת זמן למאמר ובואו מוכנים עם שאלות או דברים שתרצו לדון עליהם, אבל בסדר גם פשוט להגיע! צוות מעבדות שכבת הלימוד:
מיקום האירוע
תן לרשת שלך לדעת שאתה הולך
שתף אירוע זה כדי להתחיל שיחות, להזמין עמיתים ולהתחבר לפני תחילתו.
