
קבוצת לימוד: הסקה במערכות בינה מלאכותית
תיאור
קבוצת לימוד: הסקת LLM הצטרפו לקולקטיב AI המיושם לקבוצת לימוד מעשית על הסקת LLM ו-vLLM — כיצד מודלים לשוניים מודרניים מחולקים ביעילות, מה קורה לאחר שהבקשה מגיעה למודל, וכיצד מערכות הסקה מאזנות בין השהיה, תפוקה, זיכרון ועלות. כאשר יישומי LLM עוברים מפרוטוטיפים למוצרים בעולם האמיתי, ההפעלה היעילה של המודל הופכת לחלק חשוב בערכת ה-AI. לא מספיק לבחור מודל כישרוני — בונים צריכים גם להבין כיצד המודל הזה מוגש, כיצד הבקשות מעובדות, כיצד משאבי GPU מנוצלים, וכיצד ביצועי ההסקה משתנים כאשר התעבורה גדלה. המפגש הזה תוכנן כדון ידידותי לבונים עבור מהנדסים, מייסדים, חוקרים, בוני מוצרים, וחובבי AI שמעוניינים להבין טוב יותר את התשתית מאחורי שירות LLMs בהפקה. מה נדבר על: • מהי הסקת LLM ומה קורה במהלך שירות המודל • Prefill מול פענוח ולמה יש להם מאפייני ביצוע שונים • שהייה, תפוקה, טוקנים לשנייה ומדדי הסקה חשובים אחרים • כיצד חבילה וחבילה מתמדת משפרות את ניצול ה-GPU • זיכרון מטמון KV ולמה זה חשוב לביצועי הסקה • מבוא ל-vLLM וכיצד הוא מאפשר שירות LLM בתפוקה גבוהה • PagedAttention והבעיה שהיא נועדה לפתור • הכמותה וטכניקות אחרות להפחתת עלות ההסקה ושימוש בזיכרון • שירות מודלים קוד פתוח וחשיבה על GPUs, גודל מודל, וקונקורנציה • דיון פתוח סביב מסגרות הסקה, ארכיטקטורות, בוחנים, ואתגרים בפריסה בעולם האמיתי מי powinien להשתתף: בוני AI, מהנדסי תוכנה, מהנדסי ML, מייסדים, מנהלי מוצר, חוקרים, סטודנטים וכל מי שמעוניין להבין כיצד LLMs מונגשים במערכות בעולם האמיתי. אין צורך במומחיות קודמת בתשתית הסקה. הביאו את השאלות שלכם, חוויות עם כלים כמו vLLM, מודלים שפרסמתם, או מערכות AI שאתם בונים כרגע. זו קבוצת לימוד, לא הרצאה רשמית. המטרה היא ללמוד יחד, לדון בגישות מעשיות, ולבנות הבנה טובה יותר של מה קורה בין יישום LLM ל-GPUs המניעים באמת את המודל. בואו נבנה קהילה חזקה יותר סביב מערכות בינה מלאכותית מעשיות, ניתנות להרחבה, ועולם האמיתי.
תן לרשת שלך לדעת שאתה הולך
שתף אירוע זה כדי להתחיל שיחות, להזמין עמיתים ולהתחבר לפני תחילתו.
