چیپ هوش مصنوعی برودکام برای ترجمه و دوبله آفلاین

Broadcom همراه CAMB.AI یک چیپ هوش مصنوعی برای ترجمه، دوبله و شرح صوتی روی دستگاه معرفی کرده است که بدون اینترنت کار می‌کند؛ این راهکار سرعت ترجمه، حریم خصوصی و دسترسی به محتوا را افزایش می‌دهد.

.6 دیدگاه
چیپ هوش مصنوعی برودکام برای ترجمه و دوبله آفلاین

7 دقیقه

دنبال کردن در گوگل

شرکت Broadcom همراه با CAMB.AI یک چیپ هوش مصنوعی مبتنی بر پردازش در دستگاه (on-device AI) معرفی کرده است که برای انجام وظایف صوتی پیچیده مانند ترجمه گفتار، دوبله و تولید شرح صوتی طراحی شده است — و همهٔ این پردازش‌ها بدون نیاز به اتصال اینترنت انجام می‌شود. این گام نوید سرعت بالاتر در ترجمه، تقویت حفاظت از حریم خصوصی و بهبود دسترسی برای مصرف محتوای صوتی و تصویری را می‌دهد و می‌تواند نقطهٔ عطفی در توسعه تلویزیون‌های هوشمند و دستگاه‌های پخش چندرسانه‌ای باشد.

چیپ چه کاری انجام می‌دهد و چرا اهمیت دارد

چیپ جدید Broadcom با همکاری CAMB.AI قادر است ترجمهٔ گفتاری، دوبلهٔ هم‌زمان و روایت توصیفی (audio description) را مستقیماً روی همان دستگاهی که محتوا پخش می‌شود انجام دهد، به‌جای اینکه جریان صوتی یا داده‌های صوتی برای پردازش به سرورهای ابری ارسال شوند. این پردازش محلی یا on-device به این معناست که داده‌های صوتی در داخل همان سخت‌افزار باقی می‌مانند، پهنای باند اینترنت کاهش می‌یابد و محتوای خصوصی کاربران به سرورهای شخص ثالث آپلود نمی‌شود که موضوعی حیاتی در بحث‌های مربوط به حفظ حریم خصوصی و قوانین داده است.

Broadcom اعلام کرده این فناوری توانایی پشتیبانی از ترجمه به بیش از 150 زبان را دارد، اگرچه در حال حاضر این چیپ هنوز در مرحله آزمایشی است و به‌صورت عمومی در تلویزیون‌ها یا گجت‌های مصرفی عرضه نشده است. از دید فنی، آوردن قابلیت‌های ترجمه و همگام‌سازی صوتی به سمت لبهٔ شبکه (edge computing) شامل ترکیبی از مدل‌های یادگیری عمیق فشرده‌شده، کوانتیزه‌سازی مدل‌ها، بهینه‌سازی برای واحدهای پردازش عصبی (NPU) و مدیریت حافظه و انرژی در سطح سیستم‌روی‌چیپ (SoC) است؛ همهٔ این‌ها به منظور ایجاد تناسب میان دقت، سرعت و مصرف انرژی انجام می‌شود.

مزیت این رویکرد برای سازندگان تلویزیون‌های هوشمند، ست‌تاپ‌باکس‌ها، کنسول‌ها و موبایل این است که می‌توانند تجربهٔ ترجمهٔ صوتی و دوبلهٔ آنی را بدون اتکا به اتصال پایدار اینترنت ارائه دهند. این قابلیت به ویژه در محیط‌هایی با اینترنت محدود، در پروازها، در مناطق روستایی یا در دستگاه‌هایی که سازندگان استقلال شبکه‌ای را اولویت می‌دهند، ارزشمند خواهد بود. به‌علاوه، فراهم کردن دوبلهٔ خصوصی و شرح صوتی محلی می‌تواند پذیرش و دسترسی‌پذیری محتوا را برای کاربران کم‌بینا یا سالمندان افزایش دهد.

نمایش عملی و تمرکز بر دسترسی

در یک ویدیوی نمایشی که شرکت‌ها منتشر کردند، چیپ توانست شرح صوتی (audio description) و ترجمهٔ زنده برای یک قطعه از فیلم انیمیشن «Ratatuoille» را فراهم کند. در این نمایش، زیرنویس‌های هم‌زمان روی صفحه ظاهر شدند و هم‌زمان مدل هوش مصنوعی صحنه را به زبان‌های مختلف روایت کرد؛ قابلیت‌هایی که می‌تواند برای مخاطبانی با اختلال بینایی یا خانوارهای چندزبانه بسیار مفید باشد.

برای مثال، یک بینندهٔ کم‌بینا می‌تواند از شرح صوتی تولیدشده‌ی هم‌زمان برای درک جزئیات بصریِ فیلم بهره ببرد، در حالی که یک خانوادهٔ چندزبانه می‌تواند هنگام تماشای یک برنامهٔ بین‌المللی، فایل صوتی را بلافاصله به زبان محلی دریافت کند. این تجربهٔ مصرف محتوا که شامل ترجمهٔ گفتار، تطبیق لب (lip-sync) در دوبله و تنظیم لحن و حالت کلام برای حفظ طبیعی‌بودن صدا است، نیازمند ترکیبی از مدل‌های تشخیص گفتار (ASR)، ترجمه ماشینی گفتاری (speech-to-speech translation)، و تولید صدای مصنوعی با ویژگی‌های طبیعی است.

تمرکز بر دسترسی (accessibility) یک نکتهٔ کلیدی است؛ تولید شرح صوتی دقیق، توصیف صحنه‌ها، حس‌ها و عمل‌های غیرکلامی می‌تواند تجربهٔ بصری را برای افرادی که دیدشان محدود است به‌طور محسوسی بهبود دهد. این نوع کاربردها همچنین با قوانین دسترسی‌پذیری محتوا (مانند مقررات مربوط به دسترسی افراد دارای معلولیت) همخوانی دارد و می‌تواند به تولید محتوا با قابلیت‌های جهانی‌تر کمک کند.

مزایا و محدودیت‌های احتمالی

پردازش هوش مصنوعی در دستگاه دو مزیت روشن به همراه دارد: پاسخ‌دهی سریع‌تر بدون تأخیر شبکه و حفظ بهتر حریم خصوصی به این دلیل که صوت هرگز از دستگاه خارج نمی‌شود. حذف نیاز به ارسال و پردازش مداوم در ابر همچنین مصرف مکرر اینترنت را کاهش می‌دهد، زیرا لازم نیست صوت به‌صورت لحظه‌ای آپلود و دوباره دانلود شود. این ترکیب می‌تواند تلویزیون‌های هوشمند، باکس‌های استریم و گوشی‌های همراه را از نظر کارایی و خودکفایی ارتقا دهد.

از طرف دیگر، محدودیت‌هایی نیز وجود دارد که باید در نظر گرفته شوند. پردازش روی دستگاه محدودیت‌های سخت‌افزاری و انرژی دارد: مدل‌های بزرگ‌تر نیاز به حافظه و توان پردازشی بیشتری دارند و باید برای اجرا در محیط‌های کم‌مصرف بهینه شوند. همچنین توانایی مدل در مقابله با نویز محیط، گویش‌های محلی، لهجه‌ها و دیالوگ‌های پیچیده هنوز نیاز به ارزیابی گسترده در شرایط واقعی دارد. این عوامل می‌توانند بر دقت ترجمه، کیفیت صدای مصنوعی تولیدشده و هماهنگی دوبله اثر بگذارند.

  • حریم خصوصی: داده‌های صوتی به سرورهای راه دور ارسال نمی‌شود و در نتیجه بار احتمالی لو رفتن یا سوءاستفاده از صوت کاهش می‌یابد.
  • تأخیر: دوبله و ترجمهٔ بلادرنگ بدون نیاز به اتصال اینترنت و با تأخیر شبکه‌ای نزدیک به صفر امکان‌پذیر می‌شود.
  • پهنای باند: به دلیل پردازش محلی، مصرف دادهٔ مستمر کاهش می‌یابد و هزینهٔ اینترنت کاربران کمتر می‌شود.
  • دسترس‌پذیری: تولید شرح صوتی برای کاربران کم‌بینا و ارائهٔ محتوای چندزبانه به‌صورت آنی.

سوالاتی که باید دنبال شوند

با وجود هیجان‌انگیز بودن این دستاورد، سوالات و نکات نامشخصی همچنان باقی است. نسخهٔ منتشرشده از دموی این تکنولوژی کوتاه و ویرایش‌شده بود، و این باعث می‌شود اندازه‌گیری عملکرد واقعی چیپ در سناریوهای زنده، پرنویز یا دیالوگ‌های پیچیده دشوار باشد. دقت ترجمه‌ها، پیوستگی معنایی طولانی‌مدت، توانایی حفظ تن صدا و شخصیت در دوبلهٔ طولانی‌تر و طبیعی‌بودن صداهای سنتزشده از جمله مواردی هستند که نیاز به بررسی مستقل دارند.

Broadcom اشاره کرده که مدل صوتی هوش مصنوعی پشت این قابلیت هم‌اکنون توسط سازمان‌های بزرگ مانند NASCAR، Comcast و مسابقهٔ آواز یوروویژن (Eurovision Song Contest) استفاده می‌شود که به اعتبار فناوری کمک می‌کند، اما آزمایش‌های گسترده‌تر و بازخورد از طیف وسیعی از کاربران و شرایط واقعی برای تایید عملکرد و پایداری ضروری است. علاوه بر آن، پرسش‌هایی دربارهٔ نحوهٔ به‌روزرسانی مدل‌ها، مدیریت نسخه‌ها، امنیت نرم‌افزاری، و سازوکارهای حفاظت از داده در سطوح صنعتی مطرح می‌شود.

برای نمونه، سازندگان سخت‌افزار باید تصمیم بگیرند که آیا مدل‌ها را به‌صورت محلی به‌روزرسانی کنند، یا از یک سیستم ترکیبی استفاده شود که در آن آپدیت‌های مدل به‌صورت امن و فشرده برای اجرا روی دستگاه‌ها توزیع می‌شود. همچنین نحوهٔ تعامل این قابلیت‌ها با قوانین حفاظت از داده‌های منطقه‌ای (مثل GDPR در اتحادیهٔ اروپا) و استانداردهای دسترس‌پذیری ملی اهمیت دارد. در نهایت، پذیرش بازار بستگی به این دارد که تولیدکنندگان محتوا، ناشران و پخش‌کنندگان چگونه و تا چه اندازه به این شیوهٔ جدید پردازش اعتماد کنند و آن را در زنجیرهٔ تولید محتوایشان بگنجانند.

در مجموع، همکاری Broadcom و CAMB.AI نشانهٔ یک گسترش واضح در جهت انتقال عملکردهای پیشرفتهٔ هوش مصنوعی به سطح دستگاه است تا سرعت، حریم خصوصی و دسترسی را بهبود بخشد. اگر تولیدکنندگان دستگاه این چیپ را در تلویزیون‌ها، گیرنده‌ها و دیگر الکترونیک‌های مصرفی ادغام کنند، کاربران می‌توانند دوبله و شرح صوتی خصوصی و آنی را بدون اتکا به اینترنت تجربه کنند — البته به شرطی که عملکرد دنیای واقعی با دموی اولیه همخوانی داشته باشد.

نکتهٔ دیگری که باید به آن توجه شود، حوزهٔ کاربردهای تجاری و حرفه‌ای است: پخش‌کنندگان ورزشی، شبکه‌های خبری و سرویس‌های پخش زنده می‌توانند از ترجمهٔ هم‌زمان و تولید صدای محلی بهره‌مند شوند تا مخاطبان بین‌المللی خود را بهتر پوشش دهند. همچنین در محیط‌های آموزشی و جلسات آنلاین، فراهم بودن ترجمهٔ آفلاین می‌تواند به افزایش مشارکت کاربران غیرانگلیسی‌زبان کمک کند. در مقیاس صنعت، این فناوری می‌تواند راهکارهایی برای کاهش هزینه‌های سرویس‌های ابری ترجمه و تبدیل صوت به متن فراهم سازد و هم‌زمان کنترل بیشتری بر داده‌های حساس ایجاد کند.

در مجموع، ترکیب تکنیک‌های فشرده‌سازی مدل، بهینه‌سازی سطح سخت‌افزار و طراحی رابط‌های کاربری مناسب برای فعال‌سازی آسان این ویژگی‌ها، مشخص خواهد کرد که این فناوری تا چه اندازه در عمل کاربردی و مقیاس‌پذیر خواهد بود. زمان و آزمون‌های میدانی روشن خواهد کرد که آیا وعده‌های دقت، سرعت و حریم خصوصی به‌طور کامل محقق می‌شوند یا خیر.

کامران تهرانی
"رویدادهای مهم حوزه فناوری و فرهنگ دیجیتال را پیگیری می‌کنم و سعی می‌کنم با زبانی قابل‌فهم تحولات پیچیده را برای عموم توضیح دهم."

نظر بگذارید

نظرات (6)

ابرتک

این وعده‌ها خوبه اما بازار قبل از اینکه واقعی شه صبر می‌خواد. قیمت و پشتیبانی از استانداردها هم مهمه.

سفرلاین

تجربه edge computing جذابه اما چقدر انرژی مصرف میکنه و مدل‌ها رو چطور به‌روزرسانی می‌کنند؟

لابکور

من به عنوان کاربر کم‌بینا خیلی خوشحال می‌شم اگر شرح صوتی محلی درست شه. اما حفظ امنیت داده‌ها چطور تضمین میشه؟

توربو_مک

واقعاً؟ دموی کوتاه چقدر واقعیه. با نویز، لهجه و صداهای غیرمعمول چطور کنار می‌آد؟

کوینپایلوت

به‌به این خبر خیلی خوبه! یعنی توی پرواز یا روستا هم می‌تونیم بدون اینترنت دوبله و ترجمه داشته باشیم؟

رودکس

واا اگر این واقعیت باشه، دنیا رنگ تازه‌ای می‌گیره! ترجمه و دوبله آفلاین روی دستگاه؟ خیلی هیجان انگیزه، ولی آیا دقتش تو شرایط واقعی هم همینه؟