آیا جهش های بعدی هوش مصنوعی با محاسبات خام رقم می خورد؟

تحلیل تازهٔ MIT نشان می‌دهد محاسبات خام عامل اصلی در دقت مدل‌های زبان بزرگ است؛ با این حال بهینه‌سازی الگوریتمی می‌تواند هزینه‌ها و مصرف انرژی را کاهش دهد و دسترسی را گسترده‌تر کند.

.
آیا جهش های بعدی هوش مصنوعی با محاسبات خام رقم می خورد؟

7 دقیقه

دنبال کردن در گوگل

خلاصهٔ کلی

محاسبات خام به‌طور پنهانی تبدیل شده‌اند به سوختی که پرشتاب‌ترین جهش‌های مرئی در حوزهٔ هوش مصنوعی را شتاب می‌دهد. برداشت مستقیم از تحلیل تازه‌ای در موسسهٔ MIT چنین است: اگرچه الگوریتم‌های هوشمند اهمیت دارند، دسترسی به منابع محاسباتی عظیم اغلب تعیین می‌کند کدام مدل‌ها در صدر قرار می‌گیرند. در این مقاله به یافته‌های آن پژوهش، پیامدهای اقتصادی و زیست‌محیطی، و راه‌های کاهش هزینه‌ها از طریق بهینه‌سازی الگوریتمی پرداخته‌ایم و جایگاه بازیگران مختلف در اکوسیستم هوش مصنوعی را تحلیل می‌کنیم.

یافته‌های پژوهش MIT

پژوهشگران MIT به رهبری Matthias Mertens و همکارانش عملکرد ۸۰۹ مدل زبان بزرگ را بررسی کردند تا روشن شود چه سهمی از دقت نهایی مدل‌ها به دلیل محاسبات صرف (compute) است و چه سهمی ناشی از نوآوری‌های الگوریتمی یا بهبودهای عمومی صنعتی. نتیجه بسیار مشخص بود: محاسبات خام به‌عنوان عامل غالب در تعیین دقت نهایی پدیدار شد و به‌طور قابل‌توجهی از پیشرفت‌های سفارشی الگوریتمی پیشی گرفت. این نتیجه نشان می‌دهد که توان پردازشی و مقیاس‌بندی سخت‌افزاری نقش محوری دارد و نوآوری‌های نرم‌افزاری، اگرچه تأثیرگذار، اغلب در سایهٔ مقیاس محاسبه قرار می‌گیرند.

تجزیه و تحلیل داده‌ها

محققان با تحلیل مجموعه‌ای از معیارها شامل مقدار عملیات محاسباتی انجام‌شده، ساختار معماری، تکنیک‌های آموزش و پارامترهای بهینه‌سازی، تلاش کردند سهم هر عامل را مقدارگیری کنند. آن‌ها دریافتند که مدل‌هایی که در صدک ۹۵ عملکرد قرار دارند، به‌طور متوسط تقریباً ۱۳۲۱ برابر محاسبات بیشتری برای آموزش نیاز داشته‌اند تا نسبت به نمونه‌های ضعیف‌تر به آن سطح عملکرد برسند. این نسبت نشان‌دهندهٔ یک اثر مقیاسی (scale effect) است: وقتی از آستانه‌های محاسباتی خاصی عبور می‌کنید، رفتار مدل به‌طور کیفی تغییر می‌کند و دقت به شکل‌هایی افزایش می‌یابد که تغییرات هوشمندانهٔ کوچک در الگوریتم به سختی می‌توانند جبران کنند.

هزینه‌های سخت‌افزار و تأثیر آن بر رقابت

هزینهٔ سخت‌افزار شکاف را عمیق‌تر می‌کند. از سال ۲۰۱۹ میانگین قیمت چیپ‌ها به شکل قابل‌توجهی افزایش یافته و تا سال ۲۰۲۵ هزینهٔ پردازنده‌ها و تجهیزات شبکه‌ای مورد نیاز برای مقیاس‌دادن بارهای کاری هوش مصنوعی حدود ۷۰ درصد افزایش یافته است. شتاب‌دهنده‌های نسل جدید مانند سری Blackwell شرکت Nvidia و دیگر تراشه‌های با کارآیی بالا در هر عملیات کاراتر شده‌اند، اما برای دنبال‌کردن مدل‌های مرزی (frontier models) همچنان به تعداد زیادی از این شتاب‌دهنده‌ها نیاز است. به همین دلیل است که غول‌های ابری (hyperscalers) و شرکت‌های پیشرو در هوش مصنوعی میلیاردها دلار در مراکز داده سرمایه‌گذاری می‌کنند و مدیرانی مانند Sam Altman به دنبال سرمایه‌های بزرگ خارجی برای تغذیه نسل بعدی دوره‌های آموزش مدل‌ها بوده‌اند.

عوامل افزایش هزینه‌ها

افزایش قیمت چیپ‌ها تنها یک روی سکه است. هزینهٔ خنک‌سازی، تأمین انرژی، زیرساخت شبکه و نگهداری نیز همزمان رشد می‌کنند. جمع‌آوری و ذخیرهٔ داده‌های آموزشی در مقیاس بزرگ، ابزارهای نرم‌افزاری پیچیده، و نیروی انسانی متخصص نیز بار هزینه‌ای افزون بر سخت‌افزار ایجاد می‌کنند. در نهایت، قابلیت دسترسی به منابع مالی و زیرساختی مشخص می‌کند چه شرکت‌هایی می‌توانند آموزش‌های گستردهٔ مقیاس‌پذیر را اجرا کنند و این تمایز، به شکاف در توان رقابتی منجر می‌شود.

کنترل هزینه‌ها از طریق بهینه‌سازی الگوریتمی

اما همهٔ داستان دربارهٔ صرف هزینهٔ خام نیست. همان پژوهش MIT یک نقطهٔ مقابل معنادار را نیز برجسته می‌کند: بهبودهای الگوریتمی و مهندسی هنوز اهرم‌های قدرتمندی برای کاهش هزینه‌ها هستند. برای تیم‌هایی که توان خرید هزاران کارت گرافیک سطح بالا را ندارند، نرم‌افزار هوشمندتر—از هرس (pruning) و کم‌کردن دقت (quantization) تا برنامه‌ریزی‌های آموزشی بهتر و جستجوی معماری (architecture search)—می‌تواند ارزش بیشتری از هر چرخهٔ محاسباتی استخراج کند. در عمل این یعنی مدل‌های کوچکتر و به‌خوبی تنظیم‌شده می‌توانند در کارهای خاص با صرف منابعی به مراتب کمتر، به عملکردی نزدیک به سیستم‌های مرزی دست یابند.

تکنیک‌های عملی برای افزایش بهره‌وری

چند نمونهٔ عملی از روش‌هایی که مهندسان و محققان برای بهینه‌سازی مصرف محاسبات به کار می‌گیرند عبارت‌اند از: استفاده از عددگذاری‌ٔ کم‌دقت (mixed precision)، تقطیر دانش (knowledge distillation)، هرس ساختاری و غیرساختاری، کوانتیزاسیون با دقت پایین، یادگیری انتقالی (transfer learning) برای کاهش نیاز به آموزش از صفر، به‌کارگیری استراتژی‌های mini-batching و scheduleهای آموزشی تطبیقی، و جستجوی معماری خودکار (NAS). این روش‌ها نه‌تنها هزینهٔ آموزش را کاهش می‌دهند بلکه می‌توانند زمان اجرا و مصرف انرژی را نیز بهینه کنند.

تقسیم‌بندی واقع‌گرایانهٔ بازار هوش مصنوعی

یک تقسیم‌بندی عملیاتی در منظرهٔ هوش مصنوعی در حال ظهور است. در یک سوی معادله، غول‌های متمول با دسترسی به منابع محاسباتی عظیم قرار دارند که می‌توانند مدل‌های مرزی را با مقیاس و تکرار بالا نگهداری کنند. در سوی دیگر، تیم‌های چابک‌تر و کم‌هزینه‌تر قرار دارند که با تکیه بر کارایی الگوریتمی، مهندسی سیستم‌ها و خلاقیت نرم‌افزاری، راه‌حل‌های عملی و مقرون‌به‌صرفه ارائه می‌دهند. هر دو رویکرد میدان را جلو می‌برند، اما از طریق اقتصادهای متفاوت: یکی مقیاس را می‌خرد و دیگری هوشمندی و کارایی را می‌خرد.

نمونه‌ها و نقش بازیگران مختلف

شرکت‌های بزرگ ابری و برخی از رهبران صنعتی مدل‌های عظیمی را آموزش و عرضه می‌کنند که نیازمند کلاسترهای GPU/TPU گسترده و زیرساخت‌های ذخیره‌سازی و شبکهٔ پیشرفته است. در مقابل، استارتاپ‌ها و گروه‌های تحقیقاتی دانشگاهی روی ایجاد روش‌هایی برای کاهش نیاز به محاسبه متمرکز شده‌اند—مثلاً طراحی مدل‌های فشرده، استفاده از مدل‌های پایهٔ از پیش‌آموزش‌دیده برای سازگارسازی سریع و بهینه، و توسعهٔ ابزارهای متن‌باز که به تسهیل استفادهٔ اقتصادی از هوش مصنوعی کمک می‌کنند. اکوسیستم متن‌باز (open toolchains) می‌تواند به democratization دسترسی به فنّاوری کمک کند و نابرابری دسترسی به منابع را تا حدی کاهش دهد.

پیامدها برای سیاست‌گذاران، سرمایه‌گذاران و مهندسان

برای سیاست‌گذاران، سرمایه‌گذاران و مهندسان، پیام‌ها روشن‌اند. سرمایه‌گذاری در سخت‌افزار همچنان حیاتی است اگر هدف افزایش قابلیت‌های خام و پیگیری مرزهای عملکردی باشد. اما تأمین مالی پژوهش در بهینه‌سازی الگوریتمی، زنجیرهٔ ابزارهای متن‌باز و روش‌های آموزش بهتر به‌اندازهٔ سرمایه‌گذاری در سخت‌افزار مهم است تا دسترسی را گسترده‌تر کرده و هزینه‌های زیست‌محیطی و مالی را کاهش دهد. انتخاب مسیرهایی که بیشتر مورد توجه قرار می‌گیرند، سرنوشت اینکه چه کسی در موج بعدی نوآوری پیشرو خواهد بود را رقم می‌زند.

تأثیر زیست‌محیطی و مقررات

علاوه بر هزینهٔ مالی، افزایش مقیاس محاسباتی پیامدهای زیست‌محیطی دارد؛ مصرف انرژی مراکز داده و انتشار کربن مرتبط با آن موضوعات مهمی هستند. سیاست‌گذاران می‌توانند با تشویق به استفاده از انرژی‌های تجدیدپذیر، وضع استانداردهای کارآمدی، و حمایت از پژوهش در الگوریتم‌های کم‌مصرف، نقش موثری ایفا کنند. از سوی دیگر، سرمایه‌گذاران باید هزینهٔ بلندمدت زیست‌محیطی را در ارزیابی پروژه‌ها دخیل کنند تا ریسک‌های پنهان مرتبط با مقیاس‌پذیری را کاهش دهند.

تجزیه و تحلیل فنی: چرا مقیاس‌بندی تغییرات کیفی ایجاد می‌کند

چرا عبور از آستانه‌های محاسباتی باعث تغییرات کیفی در رفتار مدل می‌شود؟ چند دلیل فنی وجود دارد. اول، با افزایش محاسبات و پارامترها، ظرفیت نمایشی مدل افزایش می‌یابد و می‌تواند الگوهای زبانی یا ساختارهای پیچیده‌تری را یاد بگیرد. دوم، مجموعه‌داده‌های بزرگ‌تر و آموزش طولانی‌تر به مدل اجازه می‌دهد از تنوع داده‌ها و نمونه‌های نادر بهره ببرد. سوم، بهبود در روش‌های بهینه‌سازی و تطبیق‌های مقیاس‌بندی (مثل learning rate schedules و batch normalization در مقیاس بزرگ) همراه با حجم محاسبات بالا می‌تواند پایداری آموزش را افزایش دهد و از همگرایی به حداقل‌های بهتر اطمینان دهد. این سه عامل با هم ترکیب می‌شوند تا جهش‌های عملکردی را در سطوح بالای محاسباتی ممکن سازند.

ملاحظات در طراحی آزمایش‌ها و معیارها

برای مقایسهٔ عادلانه بین مدل‌ها باید معیارها و شرایط آزمایش همسان باشند: همان مجموعهٔ داده‌ها، همان معیارهای ارزیابی، و شفافیت در گزارش منابع محاسباتی (مانند FLOPs مصرفی، تعداد GPU/TPU و ساعت‌های آموزشی). بدون این شفافیت، مقایسهٔ تأثیر الگوریتم در برابر محاسبه می‌تواند گمراه‌کننده باشد. لذا مطالعاتی مانند پژوهش MIT که آمار گسترده‌ای از مدل‌ها را تجزیه و تحلیل می‌کنند برای درک واقعی سهم هر عامل حیاتی‌اند.

چه آینده‌ای پیش روست؟ پرسش نهایی

پس از بررسی شواهد و تحلیل پیامدها، یک پرسش ساده اما تعیین‌کننده باقی می‌ماند: آیا جهش بعدی در هوش مصنوعی توسط بزرگ‌ترین مرکز داده به‌دست خواهد آمد یا توسط الگوریتمی هوشمند که با بودجهٔ کوچکتر اجرا می‌شود؟ پاسخ احتمالی این است که هر دو دسته نقشی خواهند داشت: بازیگران متمول مرزهای عملکردی را جلو می‌برند و نوآوران کم‌هزینه راه‌حل‌های عملی و مقرون‌به‌صرفه تولید می‌کنند. اما اینکه کدام مسیر بیشتر مرجعیت خواهد یافت بستگی به سیاست‌گذاری، جریان سرمایه‌گذاری، دسترسی به ابزارهای متن‌باز و اولویت‌های اجتماعی مانند کاهش انتشار کربن و دسترسی عادلانه به فناوری دارد.

در نهایت، سوال را از خود بپرسید: آیا شما به‌عنوان پژوهشگر، سرمایه‌گذار یا سیاست‌گذار ترجیح می‌دهید در سخت‌افزار سرمایه‌گذاری کنید یا در بهینه‌سازی الگوریتمی و ابزارهای متن‌باز؟ انتخاب شما می‌تواند سهم قابل‌توجهی در شکل‌دهی به موج بعدی نوآوری در هوش مصنوعی داشته باشد.

سارا حسینی
"من تازه‌ترین خبرهای دنیای فناوری را پوشش می‌دهم؛ از رونمایی محصولات تا تحولات شرکت‌ها. هدفم این است که خبر را سریع، واضح و بدون اغراق به خواننده منتقل کنم."

نظر بگذارید

نظرات

هنوز نظری ثبت نشده. اولین نفر باشید.