
קבוצת לימוד: הסקת מסקנות במערכות AI
תיאור
קבוצת לימוד: הסקת מסקנות מ-LLM הצטרפו לקולקטיב AI המיושם לקבוצת לימוד מעשית על הסקת מסקנות מ-LLM ו-vLLM — כיצד מודלים לשוניים מודרניים משרתים ביעילות, מה קורה לאחר שבקשה מגיעה למודל, וכיצד מערכות הסקת מסקנות מאזן בין השהיה, throughput, זיכרון ועלות. ככל שנעשית המעבר מיישומי LLM מפרוטוטיפים למוצרים בעולם האמיתי, הפעלת המודל ביעילות הופכת לחלק חשוב בערימת AI. לא מספיק לבחור מודל מסוים — הבונים צריכים גם להבין כיצד המודל מוחשך, כיצד מתבצע עיבוד הבקשות, כיצד משאבי ה-GPU מנוצלים, וכיצד הביצוע של ההסקת מסקנות משתנה ככל שההתנועה גוברת. המפגש הזה מיועד לשיחה ידידותית למבנים הנדסיים, מייסדים, חוקרים, בוני מוצרים וחובבי AI המעוניינים להבין טוב יותר את התשתית שמאחורי שירות LLMs בייצור. מה נעמוד עליו: • מה היא הסקת מסקנות מ-LLM ומה קורה במהלך שירות המודל • Prefill מול פענוח ולמה יש להם מאפייני ביצוע שונים • השהיה, throughput, טוקנים לשנייה, ומדדים חשובים אחרים להסקת מסקנות • כיצד אצירת בקשות ואצירה מתמשכת משפרות את ניצול ה-GPU • KV caching ולמה זה חשוב לביצוע ההסקת מסקנות • מבוא ל-vLLM וכיצד זה מאפשר שירות LLM בקצב גבוה • PagedAttention והבעיה שהיא נועדה לפתור • קוונטיזציה וטכניקות אחרות להפחתת עלות ההסקת מסקנות ושימוש בזיכרון • שירות מודלים קוד פתוח וחשיבה על GPUs, גודל מודל, ועומס עבודה • שיחה פתוחה סביב מסגרות הסקת מסקנות, ארכיטקטורות, מדדים ואתגרים בפריסה בעולם האמיתי מי צריך להשתתף: בוני AI, מהנדסי תוכנה, מהנדסי ML, מייסדים, מנהלי מוצר, חוקרים, סטודנטים, וכל מי שמעוניין להבין כיצד MLLs משרתים במערכות בעולם האמיתי. אין צורך במומחיות קודמת בתשתית הסקת מסקנות. הביאו את השאלות שלכם, חוויות עם כלים כמו vLLM, מודלים שהטמעתם, או מערכות AI שאתם בונים כרגע. זו קבוצת לימוד, לא הרצאה פורמלית. המטרה היא ללמוד יחד, לדון בדרכים מעשיות, ולבנות הבנה טובה יותר של מה קורה בין יישום LLM وال-GPUs שמריצים בפועל את המודל. בואו נבנה קהילה חזקה יותר סביב מערכות AI מעשיות, בקנה מידה גדול, בעולם האמיתי.
תן לרשת שלך לדעת שאתה הולך
שתף אירוע זה כדי להתחיל שיחות, להזמין עמיתים ולהתחבר לפני תחילתו.









