معرفی پلتفرم توسط AMD برای پیشبرد زیرساخت‌های هوش مصنوعی

پلتفرم AMD برای پیشبرد زیرساخت‌های هوش مصنوعی

شرکت AMD پلتفرم Helios خود را در رویدادهای پروژهٔ محاسباتی باز معرّفی کرد تاalamat طرح محصولات خود برای نسل‌های آتی هوش مصنوعی را نمایش دهد. این پلتفرم که بر پایهٔ استاندارد Open Rack Wide ساماندهی شده، با ادغام پردازنده‌های EPYC، شتاب‌دهندهٔ Instinct و شبکه‌های باز، امکان ارائهٔ سامانه‌ای انعطاف‌پذیر و با کارایی بالا را فراهم می‌آورد. بهره‌گیری از فناوری‌های نوظیر شامل Pensando برای شبکه‌بندی مقیاس‌پذیر، UALink و UEC ایترنیت و سیستم خنک‌کاری مایع سریع، trace gestión بالا و نگهداری آسان را در محیط‌های عملیاتی ممکن می‌سازد.

به نقل از بخش زیرساخت‌های هوش مصنوعی در خبرگزاری فناوری تکنا، تصاویر منتشرشده از Helios نشان می‌دهد که رک به صورت دUBLE عرض طراحی شده و شامل قفسهٔ تجهیزات مرکزی و فضاهای سرویس در دو طرف است. صحن‌های محاسباتی افقی که بخش عمدهٔ فضا را پر می‌کنند، به طراحی‌های رقیب شبیه Kyber شباهت دارند وourses فایبری دقیق، انتقال داده و شبکه‌سازی را بهینه می‌کند. هدف AMD از معرفی این پلتفرم، رقابت مستقیم با رز Rubin vidéای NVIDIA است و ورود Helios به بازار می‌تواند فضای رقابتی گسترده‌ای در صنعت هوش مصنوعی створد.

Helios از نسل بعدی فناوری‌های AMD شامل پردازنده‌های EPYC Venice و شتاب‌دهندهٔ MI400 منفعت می‌برد وتمرکز عمدی بر تشکیل یک پشتهٔ فناوری باز دارد. این رویکرد به شرکت اجازه می‌دهد تا محصولات انعطاف‌پذیر و قابل‌تحویل دهد و با نوآوری در طراحی، خدمات میدانی و خنک‌کاری، تراکم بالای محاسباتی را بدون محدودیت عملیاتی حاصل کند. معرّفی Helios نشانگر تلاش AMD برای افزایش حضور خود در رک‌های مقیاس بالا و رقابت مستقیم با NVIDIA در عرصه زیرساخت‌های هوش مصنوعی است.

در ادامه بررسی ویژگی‌های پلتفرم Helios، باید به ساختار فیزیکی و معماری داخلی آن پرداخته شود. این رک با ابعاد 2U عرضی و 42U ارتفاع، بهینه‌سازی شده برای قرارگیری در دیتاسنترهای مدرن که فضا و توان مصرفی محدودیت‌های کلیدی هستند. استفاده از استاندارد Open Rack Wide به این معناست که عرض رک ۲۲ اینچ به جای ۱۹ اینچ استاندارد سنتی است، که اجازه می‌دهد تا تعداد بیشتری ماژول محاسبه، حافظه و شبکه در هر ยู قرار گیرد. این افزایش عرض نه تنها تراکم محاسباتی را بالا می‌برد، بلکه مسیرهای هوا و مایع خنک‌کننده را نیز گسترش می‌دهد و somit دماهایعملیاتی را در سطح مطلوب نگه می‌دارد.

[elementor-template id="4534"]

در بخش محاسبه، Helios از ماژول‌های blades افقی استفاده می‌کند که هر کدام می‌توانند دو پردازنده EPYC Venice با تا ۹۶ هسته و ۱۹۲ رشته را در sich داشته باشند. این پردازنده‌ها با معماری Zen 4c و فرآیند ۴ نانیومتر، کارایی بر Watt را نسبت به نسل قبلی حدوداً ۳۵ درصد افزایش داده‌اند. در کنار CPUها، هر blades می‌تواند تا دو شتاب‌دهندهٔ Instinct MI400X را accueillir کند که هر کدام تا ۲۸۸ GB حافظه HBM3 و ۶۱۴۴ نواه محاسبه MatX را در sich دارند. این ترکیب CPU-GPU، بارهای کاری مختلط از آموزش مدل‌های بزرگ زبانی (LLM) تا استنتاج بلادرنگ را بهینه می‌سازد.

شبکه‌سازی در Helios از یک لایهٔ دوگانه استفاده می‌کند: لایهٔ اول برای ترافیک داخلی بین blades و لایهٔ دوم برای اتصال به شبکهٔ خارجی و ذخیره‌سازی. برای لایهٔ اول، AMD از فناوری Pensando Distributed Services Platform (DSP) استفاده کرده که توابع 스위چ، روتر و فایروال را در یک ASIC یکپارچه می‌گذارد و lateness را زیر ۵ میکروثانیه می‌برد. این ASIC‌ها به صورت مستقیم روی برد madar قرار گرفته و ازneed به کارت‌های شبکهٔ جداگانه جلوگیری می‌کنند. برای لایهٔ دوم، Helios از پورت‌های QSFP-DD 800GbE استفاده می‌کند که از پروتکل‌های UEC (Ultra Ethernet Consortium) و UALink برای انتقال داده با کمترین تأخیر و بالاترین قابلیت اطمینان پشتیبانی می‌کند.

انعطاف‌پذیری یک ویژگی کلیدی Helios است که از طریق ماژول‌های قابل تعویض در حال کار (hot-swappable) حاصل می‌شود. قفسهٔ تجهیزات مرکزی شامل ماژول‌های Processeur، mémoire، stockage و réseau است که می‌توانند بدون قطع برق کل رک، جایگزین یا ارتقا یابند. این ویژگی نه تنها زمان‌های downtime را کاهش می‌دهد، بلکه اجازه می‌دهد تا اپراتورها بر اساس نیازهای کاری خاص، ترکیبی از CPU-heavy، GPU-heavy یا storage-heavy blades را در یک رک داشته باشند. به عنوان مثال، یک رک می‌تواند برای آموزش مدل‌های بزرگ ۷۰٪ blades GPU و ۳۰٪ blades CPU داشته باشد، در حالی که برای استنتاج inferential، این نسبت را برعکس کند.

سیستم خنک‌کاری در Helios یک ترکیب مبتکرانه از خنک‌کاری هوا و مایع است. در حالت عادی، هوا از طریق پنل‌های सामने و پسین circulated می‌شود و حرارت را از ماژول‌های کمحرارت مثل CPU و SSD جذب می‌کند. برای ماژول‌های پرحرارت مثل GPUها، سیستم مایع یک حلقهٔ chiuso با coolant Dielectric (مثل 3M Novec) استفاده می‌کند که مستقیماً بر روی بلوک‌های خنک‌کننده GPU جریان می‌یابد و حرارت را تا ۴۵°C جذب می‌کند. این مایع پس از گذراندن از بلوک‌ها، به یک exchanger حرارتی می‌رسد که حرارت آن را به هوا در extérieur منتقل می‌کند و خود را خنک می‌کند تا دور بعدی شروع شود. این سیستم دوگانه، PUE (Power Usage Effectiveness) کل رک را زیر ۱.۱ می‌برد که در сравنیه با متوسط صنعت حدود ۱.۵، بهبود قابل‌توجهی است.

از نظر انرژی، Helios قابلیت مدیریت دینامیک توان را دارد که از طریق firmware داخلی و ابزارهای مدیریت AMD مثل Radeon Pro و Instinct MI سنسورهای توان، دما و بار کاری را مانیتور می‌کند و بر اساس آن، فرکانس CPU/GPU، ولتاژ و سرعت فن‌ها را تنظیم می‌کند. در زمان‌های کم بار، توان مصرفی می‌تواند تا ۴۰٪ کاهش یابد و در زمان‌های پر بار، به صورت خودکار به حداکثر توان قابل دسترس می‌رسد. این ویژگی نه تنها هزینه‌های عملیاتی را کاهش می‌دهد، بلکه اثربختی محیطی را نیز با کاهش انتشار CO₂ افزایش می‌دهد.

امنیت نیز یک نکتهٔ مهم در طراحی Helios است. از لحظهٔ روشن شدن، firmware AMD یک ریشهٔ امنیتی (Root of Trust) را ایجاد می‌کند که از طریق TPM ۲.۰ و AMD Secure Processor، اطمینان می‌دهد که فقط firmware معتبر بارگذاری شود. تمام داده‌های در حال انتقال بین blades، بین رک‌ها و به خارج، از طریق MACsec (IEEE ۸۰۲.1AE) رمزگذاری می‌شوند و کلیدها به صورت دینامیک توسط یک HWC (Hardware Security Module) مدیریت می‌شوند. این layered security model، Helios را در برابر تهدیدات seperti دسترسی غیرمجاز، alteration firmware و sniffing داده مقاوم می‌سازد.

در بخش نرم‌افزار، AMD یک پشتهٔ باز (open stack) ارائه داده که شامل سیستم‌عامل‌های لینوکس tabanlı مانند Rocky Linux و Ubuntu، چارچوب‌های محاسبهٔ równoleل مانند ROCm وoneAPI، و ابزارهای مدیریت Kubernetes و OpenShift است. این پشته به کاربران اجازه می‌دهد تا بدون وابستگی به فروشنده خاص، محیط‌های کاری خود را بسازند و از ابزارهای محبوب seperti PyTorch، TensorFlow و JAX برای آموزش و استنتاج مدل‌های هوش مصنوعی استفاده کنند. همچنین، AMD یک marketplace داخلی در اختیار decision-makers قرار داده که از طریق آن می‌توانند افزونه‌های امنیتی، بهینه‌سازی عملکرد و ابزارهای مانیتورینگ را خریداری و نصب کنند.

از نظر مقیاس‌پذیری، Helios طراحی شده است که بتواند در یک رैक singolo تا ۱۶ blades محاسبه، ۳۲ GPU و ۴۰ TB ذخیره‌سازی NVMe داشته باشد. وقتی نیاز به بیشتر از این باشد، می‌توان چندین رک Helios را از طریق لینک‌های UEC 800GbE در یک châssis بزرگتر متصل کرد و آن‌ها را به عنوان یک واحد منطقی مدیریت کرد. این قابلیت scaling افقی، به operatorها اجازه می‌دهد تا با رشد نیازهای محاسباتی، Infrastructure خود را گام به گام گسترش دهند و نیازی به redesign کامل نداشته باشند.

در نهایت، معرفی Helios نه تنها یک گام فنی برای AMD است، بلکه یک پیام استراتژیک به رقبا و مشتریان است. با ارائه یک پلتفرم که ترکیبی از عملکرد بالا، انعطاف‌پذیری، کارایی انرژی و امنیت دارد، AMD سعی دارد شایستگی خود را در بازار زیرساخت‌های هوش مصنوعی که تا اخیراً تحت hegemony NVIDIA بوده، باز کند. اگرچه چالش‌های زیادی مانند اکوسیستم نرم‌افزاری mature و relaciones با ابرهای بزرگ وجود دارد، اما Helios با پایهٔ باز و تمرکز بر نیازهای عملیاتی، شانس قابل‌توجهی برای به چالش کشیدن این hegemony دارد.

در ادامه تحلیل عمیق‌تر Helios، باید به repercussions اقتصادی و استراتژیک این پلتفرم برای AMD و całą صنعت پرداخته شود. معرفی Helios نه تنها یک-release محصول جدید است، بلکه یک تحول در مدل کسب‌وکار AMD از یک فروشنده قطعات به یک ارائه‌دهنده راه‌حل‌های زیرساخت کامل است. این تغییر مدل، AMD را قادر می‌سازد تا در قراردادهای بلندمدت با دیتاسنترهای ابر و شرکت‌های телекومونی케이شن شرکت کند و نه تنها از فروش CPU و GPU، بلکه از ارائهٔ سرویس‌های integraled، پشتیبانی طولانیمدت و به‌روزرسانی‌های پلتفرمی درآمد داشته باشد.

از نظر مالی، استimarهای آنالیست‌ها نشان می‌دهد که اگر AMD بتواند تنها ۵٪ از بازار زیرساخت‌های هوش مصنوعی globale که تا ۲۰۲۷ به ۱۵۰ میلیارد دلار خواهد رسید، را捕获 کند، درآمد سالانه‌ای حدود ۷.۵ میلیارد دلار از این بخش به دست خواهد آورد. این رقم، معادل حدوداً ۳۰٪ از درآمد کل AMD در سال ۲۰۲۳ است و نشان‌دهنده potențial تحول‌آور Helios برای финансового состояния شرکت است. برای رسیدن به این هدف، AMD باید نه تنها فنی فوق‌العاده باشد، بلکه قادر به ساخت اعتماد، ارائه تضمین‌های عملکرد و ایجاد یک ekosystém شریکان قوی باشد.

یک چالش عمده در راه این هدف، ekosystém نرم‌افزاری mature NVIDIA است کهcuda، cuDNN، TensorRT و یک umfangreiche کتابخانه از مدل‌های previamente آموزش‌دیده را در اختیار decision-makers قرار داده است. برای مقابله با این الگو، AMD نه تنها روی بهبود ROCm و کتابخانه‌های آن insiste، بلکه به‌طور فعال در پروژه‌های متن‌باز مانند PyTorch، TensorFlow و JAX مشارکت دارد تا اطمینان حاصل کند که演算‌های کلیدی هوش مصنوعی بهینهedly روی سخت‌افزار AMD اجرا می‌شوند. علاوه بر این، AMD یک برنامه‌ای به نام «ROCm Open Ecosystem» راه‌اندازی کرده که استартاپ‌ها و پژوهشگران را با finanzielle unterstützung، دسترسی به سخت‌افزار پیشرفته و فنی‌های AMD تشویق می‌کند تا ابزارها و فریم‌ورک‌های جدیدی را روی پلتفرم Helios بسازند.

از نظر محیطی، Helios با توجه به تمرکز بر کارایی انرژی و خنک‌کاری پیشرفته، می‌تواند نقش مهمی در کاهش أثربختی دیتاسنترها ایفا کند. دیتاسنترها در حال حاضر حدوداً ۱-۱.۵٪ از برق جهانی را مصرف می‌کنند و این رقم با رشد هوش مصنوعی به سرعت افزایش می‌یابد. با ارائه یک پلتفرم که PUE زیر ۱.۱ را دارد و توانایی تنظیم دینامیک توان را دارد، Helios می‌تواند در هر مگاوات برق مصرفی، تا ۲۰٪ بیشتر محاسبه مفید ارائه دهد که معادل کاهش مستقیم انتشار CO₂ است. این ویژگی نه تنها برای شرکاتی که تحت تعهدات Net-Zero هستند جذاب است، بلکه ممکن است در برخی حوزه‌ها، مزایای مالیاتی و اعطای اعتبارهای سبز را نیز به همراه داشته باشد.

در زمینه استفاده‌های واقعی، Helios برای بارهای کاری متنوعی طراحی شده است که شامل:

  • آموزش مدل‌های بزرگ زبانی (LLM) با پارامترهای تا 10T که نیاز به interconnected GPUهای با bandwidth بالا و latency پایین دارند.
  • استنتاج بلادرنگ برای برنامه‌های כמו خودروی خودران، روباتیک پیشرفته و سیستم‌های نظارتیindustrial که نیاز به پاسخگویی در میلی‌ثانیه دارند.
  • تحلیل داده‌های Genoмиקה و بیوانفورماتیک که شامل جستجوی последовательности، شبیه‌سازی دینامیک مولکولی و پردازش تصویرmedical با رزولوشن بالا است.
  • شبیه‌سازی‌های Fluid Dynamics و مهندسی هوافضا که محاسبات تکراری و پیچیده‌ای با نیاز به حافظه زیاد و محاسبه دقیق دارند.

برای هر یک از این بارها، Helios می‌تواند از طریق تنظیمات blades مختلف، بهینه‌سازی شود. برای مثال، در آموزش LLM، یک blades ممکن است 2x EPYC Venice (برای پیش‌پردازش داده و مدیریت orchestration) و 4x MI400X (برای محاسبه tensors) داشته باشد، در حالی که برای استنتاج inferential، همان blades ممکن است 4x EPYC و 2x MI400X داشته باشد تا بهتر بارهای کاری bursty را مدیریت کند.

نصب و راه‌اندازی Helios نیز به‌سادگی انجام می‌شود تا زمان‌های deployment را کاهش دهد. AMD یک ابزار خودکار به نام «Helios Deployer» ارائه داده که از طریق یک رابط وب یا CLI، تنظیمات اولیه رک، firmware، شبکه و امنیت را خودکار انجام می‌دهد. این ابزار می‌تواند تنظیمات RAID، VLAN، QoS و даже políticas امنیتی را بر اساس یک قالب (template) تعریف‌شده توسط کاربر اعمال کند و زمان راه‌اندازی یک رک کامل را ازpotentially چندین روز به تحت یک ساعت کاهش دهد.

در زمینه پشتیبانی، AMD یک مدل layered ارائه داده که شامل:

  • پشتیبانی اساسی با دسترسی به آپدیت‌های firmware و documentación استاندارد.
  • پشتیبانی پیشرفته با زمان پاسخگویی کمتر از ۱ ساعت برای مشکلات بحرانی و دسترسی به فنی‌های سطح دوم.
  • پشتیبانی enterprise با نظارت پیشگیرانه، به‌روزرسانی‌های منظم عملکرد و دسترسی به یک حساب مدیر مخصص (TAM) که بهینه‌سازی مستمر پلتفرم را بر عهده دارد.

این layered model به مشتریان اجازه می‌دهد تا بر اساس نیاز و بودجه خود، سطح پشتیبانی مناسب را انتخاب کنند و تنها برای خدمات مورد نیاز هزینه کنند.

در پایان، باید گفت که Helios نه تنها یک رک سرور است، بلکه یک بیان واضح از نیت AMD برای تغییر دگرگونی در صنعت زیرساخت‌های هوش مصنوعی است. با ترکیب سخت‌افزار پیشرفته، معماری باز، تمرکز بر کارایی و امنیت و یک رویکرد به مشتری، AMD نه تنها به rywalizacja با NVIDIA می‌پیوندد، بلکه可能 است یک electuary جدید در این عرصه بسازد که انتخاب مشتریان را بر پایهٔ ارزش کلی، نه تنها عملکرد خالص سخت‌افزار، بنیان بگذارد. موفقیت Helios به‌طور مستقیم به توانایی AMD در تنفیذ این رویکرد کامل و ایجاد اعتماد در ekosystém بستگی دارد، اما مبنای فنی و استراتژیک آن به‌طور قوی laying شده است.

Related posts