7 دقیقه
خلاصهٔ کلی
محاسبات خام بهطور پنهانی تبدیل شدهاند به سوختی که پرشتابترین جهشهای مرئی در حوزهٔ هوش مصنوعی را شتاب میدهد. برداشت مستقیم از تحلیل تازهای در موسسهٔ MIT چنین است: اگرچه الگوریتمهای هوشمند اهمیت دارند، دسترسی به منابع محاسباتی عظیم اغلب تعیین میکند کدام مدلها در صدر قرار میگیرند. در این مقاله به یافتههای آن پژوهش، پیامدهای اقتصادی و زیستمحیطی، و راههای کاهش هزینهها از طریق بهینهسازی الگوریتمی پرداختهایم و جایگاه بازیگران مختلف در اکوسیستم هوش مصنوعی را تحلیل میکنیم.
یافتههای پژوهش MIT
پژوهشگران MIT به رهبری Matthias Mertens و همکارانش عملکرد ۸۰۹ مدل زبان بزرگ را بررسی کردند تا روشن شود چه سهمی از دقت نهایی مدلها به دلیل محاسبات صرف (compute) است و چه سهمی ناشی از نوآوریهای الگوریتمی یا بهبودهای عمومی صنعتی. نتیجه بسیار مشخص بود: محاسبات خام بهعنوان عامل غالب در تعیین دقت نهایی پدیدار شد و بهطور قابلتوجهی از پیشرفتهای سفارشی الگوریتمی پیشی گرفت. این نتیجه نشان میدهد که توان پردازشی و مقیاسبندی سختافزاری نقش محوری دارد و نوآوریهای نرمافزاری، اگرچه تأثیرگذار، اغلب در سایهٔ مقیاس محاسبه قرار میگیرند.
تجزیه و تحلیل دادهها
محققان با تحلیل مجموعهای از معیارها شامل مقدار عملیات محاسباتی انجامشده، ساختار معماری، تکنیکهای آموزش و پارامترهای بهینهسازی، تلاش کردند سهم هر عامل را مقدارگیری کنند. آنها دریافتند که مدلهایی که در صدک ۹۵ عملکرد قرار دارند، بهطور متوسط تقریباً ۱۳۲۱ برابر محاسبات بیشتری برای آموزش نیاز داشتهاند تا نسبت به نمونههای ضعیفتر به آن سطح عملکرد برسند. این نسبت نشاندهندهٔ یک اثر مقیاسی (scale effect) است: وقتی از آستانههای محاسباتی خاصی عبور میکنید، رفتار مدل بهطور کیفی تغییر میکند و دقت به شکلهایی افزایش مییابد که تغییرات هوشمندانهٔ کوچک در الگوریتم به سختی میتوانند جبران کنند.
هزینههای سختافزار و تأثیر آن بر رقابت
هزینهٔ سختافزار شکاف را عمیقتر میکند. از سال ۲۰۱۹ میانگین قیمت چیپها به شکل قابلتوجهی افزایش یافته و تا سال ۲۰۲۵ هزینهٔ پردازندهها و تجهیزات شبکهای مورد نیاز برای مقیاسدادن بارهای کاری هوش مصنوعی حدود ۷۰ درصد افزایش یافته است. شتابدهندههای نسل جدید مانند سری Blackwell شرکت Nvidia و دیگر تراشههای با کارآیی بالا در هر عملیات کاراتر شدهاند، اما برای دنبالکردن مدلهای مرزی (frontier models) همچنان به تعداد زیادی از این شتابدهندهها نیاز است. به همین دلیل است که غولهای ابری (hyperscalers) و شرکتهای پیشرو در هوش مصنوعی میلیاردها دلار در مراکز داده سرمایهگذاری میکنند و مدیرانی مانند Sam Altman به دنبال سرمایههای بزرگ خارجی برای تغذیه نسل بعدی دورههای آموزش مدلها بودهاند.
عوامل افزایش هزینهها
افزایش قیمت چیپها تنها یک روی سکه است. هزینهٔ خنکسازی، تأمین انرژی، زیرساخت شبکه و نگهداری نیز همزمان رشد میکنند. جمعآوری و ذخیرهٔ دادههای آموزشی در مقیاس بزرگ، ابزارهای نرمافزاری پیچیده، و نیروی انسانی متخصص نیز بار هزینهای افزون بر سختافزار ایجاد میکنند. در نهایت، قابلیت دسترسی به منابع مالی و زیرساختی مشخص میکند چه شرکتهایی میتوانند آموزشهای گستردهٔ مقیاسپذیر را اجرا کنند و این تمایز، به شکاف در توان رقابتی منجر میشود.
کنترل هزینهها از طریق بهینهسازی الگوریتمی
اما همهٔ داستان دربارهٔ صرف هزینهٔ خام نیست. همان پژوهش MIT یک نقطهٔ مقابل معنادار را نیز برجسته میکند: بهبودهای الگوریتمی و مهندسی هنوز اهرمهای قدرتمندی برای کاهش هزینهها هستند. برای تیمهایی که توان خرید هزاران کارت گرافیک سطح بالا را ندارند، نرمافزار هوشمندتر—از هرس (pruning) و کمکردن دقت (quantization) تا برنامهریزیهای آموزشی بهتر و جستجوی معماری (architecture search)—میتواند ارزش بیشتری از هر چرخهٔ محاسباتی استخراج کند. در عمل این یعنی مدلهای کوچکتر و بهخوبی تنظیمشده میتوانند در کارهای خاص با صرف منابعی به مراتب کمتر، به عملکردی نزدیک به سیستمهای مرزی دست یابند.
تکنیکهای عملی برای افزایش بهرهوری
چند نمونهٔ عملی از روشهایی که مهندسان و محققان برای بهینهسازی مصرف محاسبات به کار میگیرند عبارتاند از: استفاده از عددگذاریٔ کمدقت (mixed precision)، تقطیر دانش (knowledge distillation)، هرس ساختاری و غیرساختاری، کوانتیزاسیون با دقت پایین، یادگیری انتقالی (transfer learning) برای کاهش نیاز به آموزش از صفر، بهکارگیری استراتژیهای mini-batching و scheduleهای آموزشی تطبیقی، و جستجوی معماری خودکار (NAS). این روشها نهتنها هزینهٔ آموزش را کاهش میدهند بلکه میتوانند زمان اجرا و مصرف انرژی را نیز بهینه کنند.
تقسیمبندی واقعگرایانهٔ بازار هوش مصنوعی
یک تقسیمبندی عملیاتی در منظرهٔ هوش مصنوعی در حال ظهور است. در یک سوی معادله، غولهای متمول با دسترسی به منابع محاسباتی عظیم قرار دارند که میتوانند مدلهای مرزی را با مقیاس و تکرار بالا نگهداری کنند. در سوی دیگر، تیمهای چابکتر و کمهزینهتر قرار دارند که با تکیه بر کارایی الگوریتمی، مهندسی سیستمها و خلاقیت نرمافزاری، راهحلهای عملی و مقرونبهصرفه ارائه میدهند. هر دو رویکرد میدان را جلو میبرند، اما از طریق اقتصادهای متفاوت: یکی مقیاس را میخرد و دیگری هوشمندی و کارایی را میخرد.
نمونهها و نقش بازیگران مختلف
شرکتهای بزرگ ابری و برخی از رهبران صنعتی مدلهای عظیمی را آموزش و عرضه میکنند که نیازمند کلاسترهای GPU/TPU گسترده و زیرساختهای ذخیرهسازی و شبکهٔ پیشرفته است. در مقابل، استارتاپها و گروههای تحقیقاتی دانشگاهی روی ایجاد روشهایی برای کاهش نیاز به محاسبه متمرکز شدهاند—مثلاً طراحی مدلهای فشرده، استفاده از مدلهای پایهٔ از پیشآموزشدیده برای سازگارسازی سریع و بهینه، و توسعهٔ ابزارهای متنباز که به تسهیل استفادهٔ اقتصادی از هوش مصنوعی کمک میکنند. اکوسیستم متنباز (open toolchains) میتواند به democratization دسترسی به فنّاوری کمک کند و نابرابری دسترسی به منابع را تا حدی کاهش دهد.
پیامدها برای سیاستگذاران، سرمایهگذاران و مهندسان
برای سیاستگذاران، سرمایهگذاران و مهندسان، پیامها روشناند. سرمایهگذاری در سختافزار همچنان حیاتی است اگر هدف افزایش قابلیتهای خام و پیگیری مرزهای عملکردی باشد. اما تأمین مالی پژوهش در بهینهسازی الگوریتمی، زنجیرهٔ ابزارهای متنباز و روشهای آموزش بهتر بهاندازهٔ سرمایهگذاری در سختافزار مهم است تا دسترسی را گستردهتر کرده و هزینههای زیستمحیطی و مالی را کاهش دهد. انتخاب مسیرهایی که بیشتر مورد توجه قرار میگیرند، سرنوشت اینکه چه کسی در موج بعدی نوآوری پیشرو خواهد بود را رقم میزند.
تأثیر زیستمحیطی و مقررات
علاوه بر هزینهٔ مالی، افزایش مقیاس محاسباتی پیامدهای زیستمحیطی دارد؛ مصرف انرژی مراکز داده و انتشار کربن مرتبط با آن موضوعات مهمی هستند. سیاستگذاران میتوانند با تشویق به استفاده از انرژیهای تجدیدپذیر، وضع استانداردهای کارآمدی، و حمایت از پژوهش در الگوریتمهای کممصرف، نقش موثری ایفا کنند. از سوی دیگر، سرمایهگذاران باید هزینهٔ بلندمدت زیستمحیطی را در ارزیابی پروژهها دخیل کنند تا ریسکهای پنهان مرتبط با مقیاسپذیری را کاهش دهند.
تجزیه و تحلیل فنی: چرا مقیاسبندی تغییرات کیفی ایجاد میکند
چرا عبور از آستانههای محاسباتی باعث تغییرات کیفی در رفتار مدل میشود؟ چند دلیل فنی وجود دارد. اول، با افزایش محاسبات و پارامترها، ظرفیت نمایشی مدل افزایش مییابد و میتواند الگوهای زبانی یا ساختارهای پیچیدهتری را یاد بگیرد. دوم، مجموعهدادههای بزرگتر و آموزش طولانیتر به مدل اجازه میدهد از تنوع دادهها و نمونههای نادر بهره ببرد. سوم، بهبود در روشهای بهینهسازی و تطبیقهای مقیاسبندی (مثل learning rate schedules و batch normalization در مقیاس بزرگ) همراه با حجم محاسبات بالا میتواند پایداری آموزش را افزایش دهد و از همگرایی به حداقلهای بهتر اطمینان دهد. این سه عامل با هم ترکیب میشوند تا جهشهای عملکردی را در سطوح بالای محاسباتی ممکن سازند.
ملاحظات در طراحی آزمایشها و معیارها
برای مقایسهٔ عادلانه بین مدلها باید معیارها و شرایط آزمایش همسان باشند: همان مجموعهٔ دادهها، همان معیارهای ارزیابی، و شفافیت در گزارش منابع محاسباتی (مانند FLOPs مصرفی، تعداد GPU/TPU و ساعتهای آموزشی). بدون این شفافیت، مقایسهٔ تأثیر الگوریتم در برابر محاسبه میتواند گمراهکننده باشد. لذا مطالعاتی مانند پژوهش MIT که آمار گستردهای از مدلها را تجزیه و تحلیل میکنند برای درک واقعی سهم هر عامل حیاتیاند.
چه آیندهای پیش روست؟ پرسش نهایی
پس از بررسی شواهد و تحلیل پیامدها، یک پرسش ساده اما تعیینکننده باقی میماند: آیا جهش بعدی در هوش مصنوعی توسط بزرگترین مرکز داده بهدست خواهد آمد یا توسط الگوریتمی هوشمند که با بودجهٔ کوچکتر اجرا میشود؟ پاسخ احتمالی این است که هر دو دسته نقشی خواهند داشت: بازیگران متمول مرزهای عملکردی را جلو میبرند و نوآوران کمهزینه راهحلهای عملی و مقرونبهصرفه تولید میکنند. اما اینکه کدام مسیر بیشتر مرجعیت خواهد یافت بستگی به سیاستگذاری، جریان سرمایهگذاری، دسترسی به ابزارهای متنباز و اولویتهای اجتماعی مانند کاهش انتشار کربن و دسترسی عادلانه به فناوری دارد.
در نهایت، سوال را از خود بپرسید: آیا شما بهعنوان پژوهشگر، سرمایهگذار یا سیاستگذار ترجیح میدهید در سختافزار سرمایهگذاری کنید یا در بهینهسازی الگوریتمی و ابزارهای متنباز؟ انتخاب شما میتواند سهم قابلتوجهی در شکلدهی به موج بعدی نوآوری در هوش مصنوعی داشته باشد.








نظر بگذارید
نظرات
هنوز نظری ثبت نشده. اولین نفر باشید.