
Senior Performance Engineer - LLM Inference Frameworks
Description
מהנדס/ת ביצועים בכיר/ה בצוות TensorRT-LLM של NVIDIA, אחראי/ת לתכנון ואופטימיזציה של מערכות inference עבור מודלים שפה גדולים על GPU. התפקיד כולל פרופיילינג וכיוונון ביצועים, ניהול זיכרון חכם, וטיפול בטכניקות מתקדמות כמו Speculative Decoding וכימות. דרוש רקע אקדמי בהנדסה או מדעי מחשב, 5+ שנות ניסיון בפיתוח תוכנה, שליטה חזקה ב-Python ופריימוורקים כמו PyTorch, וכושר עמוק בפרופיילינג וביצועי GPU. עדיפות לתרומות קודמות לפרויקטים כמו vLLM או SGLang ולהכרות עם כלים מקצועיים של NVIDIA. מיקום: יקנעם · משרה מלאה להגשת מועמדות: באתר החברה, דרך הכפתור למטה
Details
Location
false
Location
Yokneam
Senior Performance Engineer - LLM Inference Frameworks
This role is published on NVIDIA's own site. You apply there; our part is getting it seen.
Apply on the company siteAsk about this listingSource
This listing was collected from a public external source. To contact the poster, visit the original post.
Original page at nvidia.wd5.myworkdayjobs.com