شرکت AMD پلتفرم Helios خود را در رویدادهای پروژهٔ محاسباتی باز معرّفی کرد تاalamat طرح محصولات خود برای نسلهای آتی هوش مصنوعی را نمایش دهد. این پلتفرم که بر پایهٔ استاندارد Open Rack Wide ساماندهی شده، با ادغام پردازندههای EPYC، شتابدهندهٔ Instinct و شبکههای باز، امکان ارائهٔ سامانهای انعطافپذیر و با کارایی بالا را فراهم میآورد. بهرهگیری از فناوریهای نوظیر شامل Pensando برای شبکهبندی مقیاسپذیر، UALink و UEC ایترنیت و سیستم خنککاری مایع سریع، trace gestión بالا و نگهداری آسان را در محیطهای عملیاتی ممکن میسازد.
به نقل از بخش زیرساختهای هوش مصنوعی در خبرگزاری فناوری تکنا، تصاویر منتشرشده از Helios نشان میدهد که رک به صورت دUBLE عرض طراحی شده و شامل قفسهٔ تجهیزات مرکزی و فضاهای سرویس در دو طرف است. صحنهای محاسباتی افقی که بخش عمدهٔ فضا را پر میکنند، به طراحیهای رقیب شبیه Kyber شباهت دارند وourses فایبری دقیق، انتقال داده و شبکهسازی را بهینه میکند. هدف AMD از معرفی این پلتفرم، رقابت مستقیم با رز Rubin vidéای NVIDIA است و ورود Helios به بازار میتواند فضای رقابتی گستردهای در صنعت هوش مصنوعی створد.
🔗 بیشتر بخوانید: دانشمندان سیارک کوچکی را در مدار زمین کشف کردند_رنگو
Helios از نسل بعدی فناوریهای AMD شامل پردازندههای EPYC Venice و شتابدهندهٔ MI400 منفعت میبرد وتمرکز عمدی بر تشکیل یک پشتهٔ فناوری باز دارد. این رویکرد به شرکت اجازه میدهد تا محصولات انعطافپذیر و قابلتحویل دهد و با نوآوری در طراحی، خدمات میدانی و خنککاری، تراکم بالای محاسباتی را بدون محدودیت عملیاتی حاصل کند. معرّفی Helios نشانگر تلاش AMD برای افزایش حضور خود در رکهای مقیاس بالا و رقابت مستقیم با NVIDIA در عرصه زیرساختهای هوش مصنوعی است.
در ادامه بررسی ویژگیهای پلتفرم Helios، باید به ساختار فیزیکی و معماری داخلی آن پرداخته شود. این رک با ابعاد 2U عرضی و 42U ارتفاع، بهینهسازی شده برای قرارگیری در دیتاسنترهای مدرن که فضا و توان مصرفی محدودیتهای کلیدی هستند. استفاده از استاندارد Open Rack Wide به این معناست که عرض رک ۲۲ اینچ به جای ۱۹ اینچ استاندارد سنتی است، که اجازه میدهد تا تعداد بیشتری ماژول محاسبه، حافظه و شبکه در هر ยู قرار گیرد. این افزایش عرض نه تنها تراکم محاسباتی را بالا میبرد، بلکه مسیرهای هوا و مایع خنککننده را نیز گسترش میدهد و somit دماهایعملیاتی را در سطح مطلوب نگه میدارد.
🔗 بیشتر بخوانید: دستگاههای لایتنینگ اپل از فروشگاههای اروپا حذف شدند_رنگو
در بخش محاسبه، Helios از ماژولهای blades افقی استفاده میکند که هر کدام میتوانند دو پردازنده EPYC Venice با تا ۹۶ هسته و ۱۹۲ رشته را در sich داشته باشند. این پردازندهها با معماری Zen 4c و فرآیند ۴ نانیومتر، کارایی بر Watt را نسبت به نسل قبلی حدوداً ۳۵ درصد افزایش دادهاند. در کنار CPUها، هر blades میتواند تا دو شتابدهندهٔ Instinct MI400X را accueillir کند که هر کدام تا ۲۸۸ GB حافظه HBM3 و ۶۱۴۴ نواه محاسبه MatX را در sich دارند. این ترکیب CPU-GPU، بارهای کاری مختلط از آموزش مدلهای بزرگ زبانی (LLM) تا استنتاج بلادرنگ را بهینه میسازد.
شبکهسازی در Helios از یک لایهٔ دوگانه استفاده میکند: لایهٔ اول برای ترافیک داخلی بین blades و لایهٔ دوم برای اتصال به شبکهٔ خارجی و ذخیرهسازی. برای لایهٔ اول، AMD از فناوری Pensando Distributed Services Platform (DSP) استفاده کرده که توابع 스위چ، روتر و فایروال را در یک ASIC یکپارچه میگذارد و lateness را زیر ۵ میکروثانیه میبرد. این ASICها به صورت مستقیم روی برد madar قرار گرفته و ازneed به کارتهای شبکهٔ جداگانه جلوگیری میکنند. برای لایهٔ دوم، Helios از پورتهای QSFP-DD 800GbE استفاده میکند که از پروتکلهای UEC (Ultra Ethernet Consortium) و UALink برای انتقال داده با کمترین تأخیر و بالاترین قابلیت اطمینان پشتیبانی میکند.
انعطافپذیری یک ویژگی کلیدی Helios است که از طریق ماژولهای قابل تعویض در حال کار (hot-swappable) حاصل میشود. قفسهٔ تجهیزات مرکزی شامل ماژولهای Processeur، mémoire، stockage و réseau است که میتوانند بدون قطع برق کل رک، جایگزین یا ارتقا یابند. این ویژگی نه تنها زمانهای downtime را کاهش میدهد، بلکه اجازه میدهد تا اپراتورها بر اساس نیازهای کاری خاص، ترکیبی از CPU-heavy، GPU-heavy یا storage-heavy blades را در یک رک داشته باشند. به عنوان مثال، یک رک میتواند برای آموزش مدلهای بزرگ ۷۰٪ blades GPU و ۳۰٪ blades CPU داشته باشد، در حالی که برای استنتاج inferential، این نسبت را برعکس کند.
سیستم خنککاری در Helios یک ترکیب مبتکرانه از خنککاری هوا و مایع است. در حالت عادی، هوا از طریق پنلهای सामने و پسین circulated میشود و حرارت را از ماژولهای کمحرارت مثل CPU و SSD جذب میکند. برای ماژولهای پرحرارت مثل GPUها، سیستم مایع یک حلقهٔ chiuso با coolant Dielectric (مثل 3M Novec) استفاده میکند که مستقیماً بر روی بلوکهای خنککننده GPU جریان مییابد و حرارت را تا ۴۵°C جذب میکند. این مایع پس از گذراندن از بلوکها، به یک exchanger حرارتی میرسد که حرارت آن را به هوا در extérieur منتقل میکند و خود را خنک میکند تا دور بعدی شروع شود. این سیستم دوگانه، PUE (Power Usage Effectiveness) کل رک را زیر ۱.۱ میبرد که در сравنیه با متوسط صنعت حدود ۱.۵، بهبود قابلتوجهی است.
از نظر انرژی، Helios قابلیت مدیریت دینامیک توان را دارد که از طریق firmware داخلی و ابزارهای مدیریت AMD مثل Radeon Pro و Instinct MI سنسورهای توان، دما و بار کاری را مانیتور میکند و بر اساس آن، فرکانس CPU/GPU، ولتاژ و سرعت فنها را تنظیم میکند. در زمانهای کم بار، توان مصرفی میتواند تا ۴۰٪ کاهش یابد و در زمانهای پر بار، به صورت خودکار به حداکثر توان قابل دسترس میرسد. این ویژگی نه تنها هزینههای عملیاتی را کاهش میدهد، بلکه اثربختی محیطی را نیز با کاهش انتشار CO₂ افزایش میدهد.
امنیت نیز یک نکتهٔ مهم در طراحی Helios است. از لحظهٔ روشن شدن، firmware AMD یک ریشهٔ امنیتی (Root of Trust) را ایجاد میکند که از طریق TPM ۲.۰ و AMD Secure Processor، اطمینان میدهد که فقط firmware معتبر بارگذاری شود. تمام دادههای در حال انتقال بین blades، بین رکها و به خارج، از طریق MACsec (IEEE ۸۰۲.1AE) رمزگذاری میشوند و کلیدها به صورت دینامیک توسط یک HWC (Hardware Security Module) مدیریت میشوند. این layered security model، Helios را در برابر تهدیدات seperti دسترسی غیرمجاز، alteration firmware و sniffing داده مقاوم میسازد.
در بخش نرمافزار، AMD یک پشتهٔ باز (open stack) ارائه داده که شامل سیستمعاملهای لینوکس tabanlı مانند Rocky Linux و Ubuntu، چارچوبهای محاسبهٔ równoleل مانند ROCm وoneAPI، و ابزارهای مدیریت Kubernetes و OpenShift است. این پشته به کاربران اجازه میدهد تا بدون وابستگی به فروشنده خاص، محیطهای کاری خود را بسازند و از ابزارهای محبوب seperti PyTorch، TensorFlow و JAX برای آموزش و استنتاج مدلهای هوش مصنوعی استفاده کنند. همچنین، AMD یک marketplace داخلی در اختیار decision-makers قرار داده که از طریق آن میتوانند افزونههای امنیتی، بهینهسازی عملکرد و ابزارهای مانیتورینگ را خریداری و نصب کنند.
از نظر مقیاسپذیری، Helios طراحی شده است که بتواند در یک رैक singolo تا ۱۶ blades محاسبه، ۳۲ GPU و ۴۰ TB ذخیرهسازی NVMe داشته باشد. وقتی نیاز به بیشتر از این باشد، میتوان چندین رک Helios را از طریق لینکهای UEC 800GbE در یک châssis بزرگتر متصل کرد و آنها را به عنوان یک واحد منطقی مدیریت کرد. این قابلیت scaling افقی، به operatorها اجازه میدهد تا با رشد نیازهای محاسباتی، Infrastructure خود را گام به گام گسترش دهند و نیازی به redesign کامل نداشته باشند.
در نهایت، معرفی Helios نه تنها یک گام فنی برای AMD است، بلکه یک پیام استراتژیک به رقبا و مشتریان است. با ارائه یک پلتفرم که ترکیبی از عملکرد بالا، انعطافپذیری، کارایی انرژی و امنیت دارد، AMD سعی دارد شایستگی خود را در بازار زیرساختهای هوش مصنوعی که تا اخیراً تحت hegemony NVIDIA بوده، باز کند. اگرچه چالشهای زیادی مانند اکوسیستم نرمافزاری mature و relaciones با ابرهای بزرگ وجود دارد، اما Helios با پایهٔ باز و تمرکز بر نیازهای عملیاتی، شانس قابلتوجهی برای به چالش کشیدن این hegemony دارد.
در ادامه تحلیل عمیقتر Helios، باید به repercussions اقتصادی و استراتژیک این پلتفرم برای AMD و całą صنعت پرداخته شود. معرفی Helios نه تنها یک-release محصول جدید است، بلکه یک تحول در مدل کسبوکار AMD از یک فروشنده قطعات به یک ارائهدهنده راهحلهای زیرساخت کامل است. این تغییر مدل، AMD را قادر میسازد تا در قراردادهای بلندمدت با دیتاسنترهای ابر و شرکتهای телекومونی케이شن شرکت کند و نه تنها از فروش CPU و GPU، بلکه از ارائهٔ سرویسهای integraled، پشتیبانی طولانیمدت و بهروزرسانیهای پلتفرمی درآمد داشته باشد.
از نظر مالی، استimarهای آنالیستها نشان میدهد که اگر AMD بتواند تنها ۵٪ از بازار زیرساختهای هوش مصنوعی globale که تا ۲۰۲۷ به ۱۵۰ میلیارد دلار خواهد رسید، را捕获 کند، درآمد سالانهای حدود ۷.۵ میلیارد دلار از این بخش به دست خواهد آورد. این رقم، معادل حدوداً ۳۰٪ از درآمد کل AMD در سال ۲۰۲۳ است و نشاندهنده potențial تحولآور Helios برای финансового состояния شرکت است. برای رسیدن به این هدف، AMD باید نه تنها فنی فوقالعاده باشد، بلکه قادر به ساخت اعتماد، ارائه تضمینهای عملکرد و ایجاد یک ekosystém شریکان قوی باشد.
یک چالش عمده در راه این هدف، ekosystém نرمافزاری mature NVIDIA است کهcuda، cuDNN، TensorRT و یک umfangreiche کتابخانه از مدلهای previamente آموزشدیده را در اختیار decision-makers قرار داده است. برای مقابله با این الگو، AMD نه تنها روی بهبود ROCm و کتابخانههای آن insiste، بلکه بهطور فعال در پروژههای متنباز مانند PyTorch، TensorFlow و JAX مشارکت دارد تا اطمینان حاصل کند که演算های کلیدی هوش مصنوعی بهینهedly روی سختافزار AMD اجرا میشوند. علاوه بر این، AMD یک برنامهای به نام «ROCm Open Ecosystem» راهاندازی کرده که استартاپها و پژوهشگران را با finanzielle unterstützung، دسترسی به سختافزار پیشرفته و فنیهای AMD تشویق میکند تا ابزارها و فریمورکهای جدیدی را روی پلتفرم Helios بسازند.
از نظر محیطی، Helios با توجه به تمرکز بر کارایی انرژی و خنککاری پیشرفته، میتواند نقش مهمی در کاهش أثربختی دیتاسنترها ایفا کند. دیتاسنترها در حال حاضر حدوداً ۱-۱.۵٪ از برق جهانی را مصرف میکنند و این رقم با رشد هوش مصنوعی به سرعت افزایش مییابد. با ارائه یک پلتفرم که PUE زیر ۱.۱ را دارد و توانایی تنظیم دینامیک توان را دارد، Helios میتواند در هر مگاوات برق مصرفی، تا ۲۰٪ بیشتر محاسبه مفید ارائه دهد که معادل کاهش مستقیم انتشار CO₂ است. این ویژگی نه تنها برای شرکاتی که تحت تعهدات Net-Zero هستند جذاب است، بلکه ممکن است در برخی حوزهها، مزایای مالیاتی و اعطای اعتبارهای سبز را نیز به همراه داشته باشد.
در زمینه استفادههای واقعی، Helios برای بارهای کاری متنوعی طراحی شده است که شامل:
- آموزش مدلهای بزرگ زبانی (LLM) با پارامترهای تا 10T که نیاز به interconnected GPUهای با bandwidth بالا و latency پایین دارند.
- استنتاج بلادرنگ برای برنامههای כמו خودروی خودران، روباتیک پیشرفته و سیستمهای نظارتیindustrial که نیاز به پاسخگویی در میلیثانیه دارند.
- تحلیل دادههای Genoмиקה و بیوانفورماتیک که شامل جستجوی последовательности، شبیهسازی دینامیک مولکولی و پردازش تصویرmedical با رزولوشن بالا است.
- شبیهسازیهای Fluid Dynamics و مهندسی هوافضا که محاسبات تکراری و پیچیدهای با نیاز به حافظه زیاد و محاسبه دقیق دارند.
برای هر یک از این بارها، Helios میتواند از طریق تنظیمات blades مختلف، بهینهسازی شود. برای مثال، در آموزش LLM، یک blades ممکن است 2x EPYC Venice (برای پیشپردازش داده و مدیریت orchestration) و 4x MI400X (برای محاسبه tensors) داشته باشد، در حالی که برای استنتاج inferential، همان blades ممکن است 4x EPYC و 2x MI400X داشته باشد تا بهتر بارهای کاری bursty را مدیریت کند.
نصب و راهاندازی Helios نیز بهسادگی انجام میشود تا زمانهای deployment را کاهش دهد. AMD یک ابزار خودکار به نام «Helios Deployer» ارائه داده که از طریق یک رابط وب یا CLI، تنظیمات اولیه رک، firmware، شبکه و امنیت را خودکار انجام میدهد. این ابزار میتواند تنظیمات RAID، VLAN، QoS و даже políticas امنیتی را بر اساس یک قالب (template) تعریفشده توسط کاربر اعمال کند و زمان راهاندازی یک رک کامل را ازpotentially چندین روز به تحت یک ساعت کاهش دهد.
در زمینه پشتیبانی، AMD یک مدل layered ارائه داده که شامل:
- پشتیبانی اساسی با دسترسی به آپدیتهای firmware و documentación استاندارد.
- پشتیبانی پیشرفته با زمان پاسخگویی کمتر از ۱ ساعت برای مشکلات بحرانی و دسترسی به فنیهای سطح دوم.
- پشتیبانی enterprise با نظارت پیشگیرانه، بهروزرسانیهای منظم عملکرد و دسترسی به یک حساب مدیر مخصص (TAM) که بهینهسازی مستمر پلتفرم را بر عهده دارد.
این layered model به مشتریان اجازه میدهد تا بر اساس نیاز و بودجه خود، سطح پشتیبانی مناسب را انتخاب کنند و تنها برای خدمات مورد نیاز هزینه کنند.
در پایان، باید گفت که Helios نه تنها یک رک سرور است، بلکه یک بیان واضح از نیت AMD برای تغییر دگرگونی در صنعت زیرساختهای هوش مصنوعی است. با ترکیب سختافزار پیشرفته، معماری باز، تمرکز بر کارایی و امنیت و یک رویکرد به مشتری، AMD نه تنها به rywalizacja با NVIDIA میپیوندد، بلکه可能 است یک electuary جدید در این عرصه بسازد که انتخاب مشتریان را بر پایهٔ ارزش کلی، نه تنها عملکرد خالص سختافزار، بنیان بگذارد. موفقیت Helios بهطور مستقیم به توانایی AMD در تنفیذ این رویکرد کامل و ایجاد اعتماد در ekosystém بستگی دارد، اما مبنای فنی و استراتژیک آن بهطور قوی laying شده است.