خلاصه مدیریتی

تیم پژوهشی Dharma-AI در گزارش جدید خود نشان داد که چگونه با تغییر ترتیب اجرای وظایف محاسباتی در یک خوشه (Cluster) از پردازنده‌های گرافیکی (GPU)، بدون افزودن هیچ سخت‌افزار جدیدی، بهره‌وری سیستم را ۳۳ امتیاز افزایش داده است. این دستاورد ثابت می‌کند که در زیرساخت‌های هوش مصنوعی، نحوه زمان‌بندی و صف‌بندی کارها گاهی اهمیتی هم‌سنگ با قدرت خود سخت‌افزار دارد.

لید خبری: چه کسی، چه چیزی، چه زمانی و چرا مهم است؟

چه کسی: تیم پژوهشی Dharma-AI.

چه چیزی: افزایش ۳۳ امتیازی بهره‌وری (Utilization) در یک خوشه از پردازنده‌های گرافیکی (GPU)، صرفاً با تغییر ترتیب اجرای کارها.

چه زمانی: این گزارش در تاریخ ۱۷ اوت ۲۰۲۶ (۲۶ مرداد ۱۴۰۵) منتشر شد.

چرا مهم است؟ زیرساخت‌های GPU پرهزینه‌ترین بخش اقتصاد هوش مصنوعی هستند. این روش نشان می‌دهد که شرکت‌ها و توسعه‌دهندگان می‌توانند با بهینه‌سازی نرم‌افزاری، ظرفیت‌های پنهان سخت‌افزار فعلی خود را آزاد کنند و نیاز به خرید سخت‌افزار اضافی را به تأخیر بیندازند یا حذف کنند.

شرح مفصل رخداد

در توسعه سیستم‌های هوش مصنوعی، به‌ویژه هنگام آموزش مدل‌های زبانی بزرگ (LLM) یا اجرای ایجنت‌های پیچیده، پردازنده‌های گرافیکی (GPU) نقش قلب تپنده را ایفا می‌کنند. با این حال، خرید و نگهداری این سخت‌افزارها بسیار پرهزینه است. تیم Dharma-AI در دومین بخش گزارش‌های مدیریت GPU خود (GPU Management Part 2) به بررسی این موضوع پرداخت که چرا حتی در خوشه‌های قدرتمند، بخش زیادی از توان پردازشی GPUها به‌دلیل مدیریت ضعیف وظایف هدر می‌رود.

راه‌حل ارائه‌شده توسط این تیم شامل ارتقای سخت‌افزار یا نصب دستگاه‌های جدید نبود. تغییر اصلی در «ترتیب اجرای وظایف» (Order of Execution) بود. برای درک ساده این موضوع، تصور کنید در یک رستوران بزرگ چندین آشپز (GPU) حضور دارند. اگر سفارش‌ها بدون برنامه‌ریزی به آشپزها داده شود—مثلاً یک آشپز یک غذای زمان‌بر (مثل آموزش مدل سنگین) و آشپز دیگر یک غذای سریع (مثل تست کد) دریافت کند—تا زمانی که غذای زمان‌بر آماده شود، آشپز دوم بیکار می‌ماند و ظرفیت رستوران هدر می‌رود.

تیم Dharma-AI متوجه شد که اگر وظایف بر اساس زمان مورد نیاز و میزان مصرف حافظه به‌درستی صف‌بندی شوند، می‌توان زمان‌های بیکاری (Idle Time) GPUها را به حداقل رساند. در این روش، وظایف کوتاه‌تر و سبک‌تر در فواصل بین وظایف طولانی‌تر قرار می‌گیرند. نتیجه این جابجایی هوشمندانه، افزایش ۳۳ امتیازی در نرخ بهره‌وری همان خوشه بود. بهره‌وری در اینجا به معنای درصد زمانی است که GPU در حال انجام یک کار مفید است، نه صرفاً روشن بودن و انتظار برای دریافت داده.

پیشینه و زمینه لازم

در سال‌های اخیر، با رشد تصاعدی مدل‌های هوش مصنوعی، تقاضا برای خرید GPUها به‌ویژه مدل‌های H100 شرکت انویدیا به شدت افزایش یافت. این محدودیت سخت‌افزاری باعث شد تا شرکت‌ها به دنبال راه‌حل‌های نرم‌افزاری برای مدیریت بهتر منابع باشند. در گذشته، ابزارهای مدیریت بار (Load Balancers) صرفاً وظایف را به ترتیب دریافت تقسیم می‌کردند (روش FIFO یا اولین وارد، اولین خارج). اما روش‌های جدیدتر، الگوریتم‌های زمان‌بندی هوشمندانه‌تری را برای پیش‌بینی زمان اتمام کار و تخصیص منابع پیاده‌سازی می‌کنند.

نکات و حقایق کلیدی

  • تثبیت سخت‌افزار: این آزمایش روی همان خوشه قبلی انجام شد و هیچ GPU جدیدی اضافه نشد.
  • افزایش ۳۳ امتیازی: این عدد نشان‌دهنده جهش قابل‌توجه در بهره‌وری است که معادل صرفه‌جویی چشمگیر در هزینه‌های ابری و انرژی است.
  • نقش ترتیب‌بندی: عامل اصلی موفقیت، تغییر الگوریتم زمان‌بندی و صف‌بندی وظایف بود.
  • کاهش گلوگاه‌ها: با این روش، وظایف کوچک‌تر در فضاهای خالی بین وظایف بزرگ اجرا شدند و از ایجاد صف‌های طولانی انتظار جلوگیری شد.

اهمیت برای کاربران عمومی

برای کاربران عادی و کسب‌وکارها، این دستاورد به معنای کاهش هزینه‌های توسعه خدمات هوش مصنوعی است. وقتی بهره‌وری زیرساخت افزایش می‌یابد، شرکت‌های ارائه‌دهنده خدمات ابری می‌توانند هزینه‌های خود را کاهش دهند و این کاهش قیمت نهایتاً به کاربران نهایی خدمات مبتنی بر هوش مصنوعی منتقل می‌شود. همچنین، استفاده بهینه از سخت‌افزار به معنای مصرف انرژی کمتر و کاهش اثرات زیست‌محیطی مراکز داده است.

اثر بر فریلنسرها، کارفرمایان و فعالان بازار ایجنت هوش مصنوعی ایران

برای کارفرمایان و توسعه‌دهندگانی که درگیر پروژه‌های هوش مصنوعی هستند، این گزارش یک درس مهم دارد: پیش از خرید سخت‌افزار یا فضای ابری گران‌قیمت، باید از بهینه‌سازی نرم‌افزاری اطمینان حاصل کرد. در پلتفرم‌هایی مانند ایران‌ایجنت (IranIAgent) که به عنوان بازار خرید و فروش ایجنت هوش مصنوعی ایران فعالیت می‌کنند، فریلنسرها و متخصصان می‌توانند با تسلط بر تکنیک‌های مدیریت منابع GPU، پروژه‌های بهینه‌سازی زیرساخت را به کارفرمایان پیشنهاد دهند.

اگر شما یک فریلنسر هوش مصنوعی هستید، ارائه راهکارهای بهینه‌سازی زمان‌بندی می‌تواند یک مهارت پرتقاضا در پروژه‌های هوش مصنوعی باشد. از سوی دیگر، کارفرمایانی که قصد خرید ایجنت هوش مصنوعی یا سفارش ساخت ایجنت‌های اختصاصی را دارند، باید اطمینان حاصل کنند که توسعه‌دهنده آن‌ها از روش‌های مدیریت منابع کارآمد استفاده می‌کند تا هزینه‌های اجرای طولانی‌مدت ایجنت به حداقل برسد.

تحلیل فنی و تجاری

از منظر فنی، این دستاورد بر پایه مفهوم «تفرقه و تسخیر» (Divide and Conquer) در زمان‌بندی (Scheduling) استوار است. در سیستم‌های توزیع‌شده، زمانی که یک GPU یک کار طولانی را شروع می‌کند، منابع حافظه آن بلوکه می‌شود. اگر در این میان یک کار کوتاه وارد سیستم شود، باید تا اتمام کار قبلی منتظر بماند. اما با الگوریتم‌های پیش‌بینی‌کننده (Predictive Scheduling) یا روش‌های مشابه زمان‌بندی عقب‌گرد (Backfilling)، سیستم می‌تواند کارهای کوچک را در شکاف‌های زمانی موجود اجرا کند.

از منظر تجاری، افزایش ۳۳ درصدی بهره‌وری معادل این است که یک شرکت با داشتن ۱۰۰ پردازنده گرافیکی، عملاً به قدرت ۱۳۳ پردازنده دسترسی پیدا کند. در قیمتی که هر GPU هزاران دلار ارزش دارد، این بهینه‌سازی صرفه‌جویی مالی مستقیمی به همراه دارد.

محدودیت‌ها، ریسک‌ها و ابهام‌ها

با وجود اهمیت این خبر، باید به محدودیت‌های آن توجه کرد:

  • وابستگی به نوع کار: این روش برای کارهایی که زمان اجرای آن‌ها قابل پیش‌بینی است به خوبی جواب می‌دهد. اگر وظایف دارای زمان اجرای نامشخص باشند، زمان‌بندی پیچیده می‌شود.
  • ریسک قطع وظایف: در برخی روش‌های جابجایی، ممکن است نیاز به توقف و از سراغ مجدد کارها باشد که برای برخی مدل‌ها هزینه‌بر است.
  • اطلاعات محدود منبع: گزارش منبع عمدتاً بر نتیجه نهایی تمرکز دارد و جزئیات دقیق الگوریتم استفاده‌شده و نوع معماری سخت‌افزاری به طور کامل در دسترس عموم قرار نگرفته است.

نتیجه‌گیری کاربردی

دستاورد تیم Dharma-AI یک یادآوری مهم برای اکوسیستم هوش مصنوعی است: «قدرت نرم‌افزار نباید دست‌کم گرفته شود». پیش از آنکه به فکر توسعه فیزیکی زیرساخت‌ها باشیم، باید الگوریتم‌های مدیریت وظایف و زمان‌بندی را بهینه‌سازی کنیم. برای متخصصان و کارفرمایان ایرانی، این رویکرد می‌تواند به عنوان یک راهکار عملی برای کاهش هزینه‌های توسعه و اجرای ایجنت‌های هوش مصنوعی در نظر گرفته شود.

منابع

  • Hugging Face Blog: Same Cluster, 33 Points More Utilization: What Changed Was the Order (Dharma-AI)