توسعه زیرساخت هوش مصنوعی با رویکرد بومی در پروژه سکوی ملی

مدیر گروه پلتفرم سکوی ملی هوش مصنوعی از ایجاد و پیاده‌سازی زیرساختی بومی به منظور مدیریت منابع پردازشی محدودی خبر داد و اظهار داشت: با توجه به محدودیت‌های موجود در GPU، CPU و فضای ذخیره‌سازی، با طراحی یک لایه واسط بین سخت‌افزار و لایه اجرایی، توانسته‌ایم به حداکثر استفاده از این منابع دست یابیم. وی همچنین یادآور شد که این زیرساخت سه‌لایه از نظر استانداردهای بین‌المللی قابلیت رقابت دارد و برای همکاری با گروه‌های مشتاق آمادگی کامل داریم.

به نقل از ایسنا، جمال امیدی، در نشستی با حضور فعالان حوزه هوش مصنوعی به تشریح فرایند طراحی زیرساخت این سکو پرداخت و با اشاره به منابع محدود سخت‌افزاری مانند GPU، CPU و فضای ذخیره‌سازی، توضیح داد: اگر این منابع به‌صورت عمومی و عادی مورد استفاده قرار می‌گرفتند، به عملکرد مطلوب نمی‌رسیدند. به همین خاطر، تصمیم بر این شد که یک لایه واسط بین لایه اجرایی سکو و سخت‌افزارهای موجود طراحی کنیم تا بالاترین بهره‌وری ممکن از این منابع حاصل شود.

وی با تأکید بر تجربیات گذشته در توسعه سیستم‌های مقیاس‌پذیر، بیان داشت: هدف ما این بوده که منابع داخلی محدود و ظرفیت‌های خارجی را در یک چارچوب منسجم و سازمان‌یافته مورد استفاده قرار دهیم. در صنعت نیز با چالش‌هایی شبیه این مواجه بوده‌ایم که تحلیل و بررسی آن‌ها در طراحی این ساختار مدنظر قرار گرفته است.

مدیر گروه پلتفرم سکوی هوش مصنوعی با بیان اینکه منابع پردازشی مانند GPU، CPU و فضای ذخیره‌سازی را به‌عنوان یک «کامپیوتر» در نظر گرفته‌ایم، اضافه کرد: تخمین ما این است که برای این حوزه به تجهیزات بالغ بر ۳۰ میلیارد تومان نیاز است. اما هیچ‌یک از زیرساخت‌های موجود آمادگی لازم برای پشتیبانی از چنین ساختاری را ندارند. ما باید قادر باشیم چند صد گیگابایت داده را با سرعت بالا تغذیه و پردازش کنیم و شبکه نیز باید توانایی لازم برای این حجم را داشته باشد.

وی یکی از مسائل کلیدی را یک سیستم‌عامل کم‌حجم و بهینه برای کار با سخت‌افزارها توصیف کرد و خاطرنشان ساخت: ما سیستم‌عاملی بسیار سبک و شناخته‌شده جهانی را کرده‌ایم که هدف آن مدیریت دقیق منابع سخت‌افزاری باشد و تغییرات سیستم از یک مرکز کنترل واحد به آن ارجاع داده شود.

این فعال در حوزه توسعه زیرساخت‌های هوش مصنوعی ادامه داد: در مثال یک فرایند یادگیری ماشین توزیع‌شده، احتمال دارد هزاران پروسه به‌طور هم‌زمان روی حجم زیادی از داده فعالیت کنند. زمان‌بندی و توزیع این تسک‌ها بر روی سخت‌افزار نیازمند یک لایه استاندارد و تخصصی است که در زیرساخت‌های معمول قابل پیاده‌سازی نیست. لذا از ابزارهایی استفاده کرده‌ایم که در مدیریت توزیع و هماهنگی وظایف دارای کارایی بالا باشند.

وی به برخی راهکارهای متداول مانند SLURM اشاره کرد و گفت: در حالی که ابزارهایی مانند «اسلار» در پروژه‌های بین‌المللی به کار برده می‌شوند، اما با زیرساخت‌های مدرن هماهنگی ندارند. ما تنها تجربیات قبلی از استفاده از اسلار را مورد بررسی قرار داده و ساختاری مشابه را به سیستم‌عامل خود افزودیم.

این فعال فناور با بیان اینکه زیرساخت در حال حاضر در سه لایه اصلی طراحی شده و قابل استفاده است، توضیح داد: شبکه‌ای مبتنی بر RDMA و نسخه دوم RoCE برای ارتباط سریع بین GPUها در نظر گرفته‌ایم و همچنین یک شبکه ذخیره‌سازی پرسرعت مبتنی بر Ceph برای تامین سریع مدل‌های هوش مصنوعی فراهم کرده‌ایم.

وی چالش ذخیره‌سازی را به‌عنوان یکی از مسائل اساسی در یادگیری عمیق برشمرد و گفت: در پروژه‌های یادگیری عمیق، نیاز به دسترسی همزمان به حجم زیادی از داده وجود دارد. در اکثر سیستم‌های ذخیره‌سازی رایج، اگر یک فرایند به یک فایل دسترسی یابد، سایر فرآیندها نمی‌توانند به‌صورت همزمان از آن استفاده کنند. بنابراین، در طراحی این ساختار لازم است امکان پردازش همزمان و انتقال موازی داده‌ها با هزینه‌ای منطقی پیش‌بینی شود.

وی همچنین اضافه کرد: ما نمی‌توانیم در این مقیاس از ذخیره‌سازی‌های تجاری با هزینه‌های بالا استفاده کنیم. بنابراین به‌جای خرید تجهیزات گران‌قیمت، از راه‌حل‌های تعریف‌شده و دیفایند بهره برده‌ایم که هزینه کمتری دارد و بهره‌وری بالاتری را ارائه می‌دهد.

امیدی با اشاره به دو ویژگی اصلی در لایه پردازش، بیان کرد: یکی از این ویژگی‌ها، قابلیت کار با مدل‌های بزرگ مبتنی بر دیتابیس است، به گونه‌ای که امکان تقسیم مدل روی چندین GPU وجود داشته باشد. برای مدل‌هایی با پارامترهای بسیار بالا، اجرای آن‌ها بر روی یک یا دو GPU کفایت نمی‌کند و نیاز به توزیع بخش‌های مختلف آن بر روی چند پردازنده گرافیکی است.

مدیر گروه پلتفرم سکوی ملی هوش مصنوعی به مقایسه زیرساخت‌های مشابه بین‌المللی پرداخت و گفت: ما این ساختار را با زیرساخت‌های آمریکایی و همچنین پلتفرم‌های شرکت‌هایی چون علی‌بابا و هوآوی مقایسه کردیم و خوشبختانه نسخه تولیدی ما در بسیاری از شاخص‌ها قابلیت رقابت با خدمات مشابه را دارد.

امیدی همچنین تصریح کرد: اگر افرادی در کشور تجربه‌های مشابهی دارند، ما از آن‌ها به گرمی استقبال می‌کنیم. هدف ما تکرار کارهای گذشته نیست. هرچه سریع‌تر و با هزینه کمتر به نتیجه برسیم، به نفع کشور خواهد بود. زیرساختی که طراحی کرده‌ایم در حال حاضر قابل پیاده‌سازی است و ما برای همکاری با گروه‌های مشتاق آماده‌ایم.

مشاهده بیشتر

نوشته های مشابه

دکمه بازگشت به بالا