اومنی وویس شیائومی؛ مدل متن به گفتار چندزبانه

شیائومی مدل متن‌باز OmniVoice را معرفی کرده؛ یک مدل پیشرفته تبدیل متن به گفتار برای شبیه‌سازی صدا، تولید گفتار چندزبانه و پشتیبانی از زبان‌های کم‌منبع با سرعت و دقت بالا.

.5 دیدگاه
اومنی وویس شیائومی؛ مدل متن به گفتار چندزبانه

5 دقیقه

دنبال کردن در گوگل

هوش مصنوعی صوتی عادت دارد روی کاغذ شگفت‌انگیز به نظر برسد و در عمل، به‌طرزی عجیب بی‌روح باشد. شیائومی فکر می‌کند برای این مشکل راه‌حلی دارد. این شرکت مدل OmniVoice را متن‌باز کرده است؛ یک مدل جدید تبدیل متن به گفتار که برای شبیه‌سازی صدا، تولید گفتار چندزبانه و کنترل دقیق روی این‌که صدای مصنوعی واقعاً چگونه شنیده شود، ساخته شده است.

آنچه این عرضه را متمایز می‌کند فقط وعده همیشگیِ گفتار تمیزتر یا خروجی سریع‌تر نیست. شیائومی OmniVoice را به‌عنوان مدلی معرفی می‌کند که می‌تواند در صدها زبان کار کند، از جمله زبان‌های کم‌منبعی که معمولاً در سیستم‌های گفتار جریان اصلی نادیده گرفته می‌شوند. اگر این ادعا فراتر از نمایش‌های آزمایشگاهی هم دوام بیاورد، می‌تواند اهمیت آن بسیار فراتر از گوشی‌های پرچمدار و دستیارهای هوشمند باشد.

این اعلامیه از طریق کانال رسمی وی‌چت شیائومی منتشر شد؛ جایی که شرکت گفت OmniVoice در زبان‌های چینی و انگلیسی عملکرد بسیار خوبی دارد و در برخی وظایف چندزبانه، می‌تواند با گزینه‌های تجاری برابری کند یا حتی از آن‌ها بهتر باشد. این ادعای بزرگی است. اما جزئیات نشان می‌دهد که شیائومی یک نقطه درد واقعی در فناوری گفتار را هدف گرفته است: بیشتر سیستم‌های تبدیل متن به گفتار هنوز در چند زبان اصلی بهترین عملکرد را دارند، در حالی که بقیه زبان‌ها نسخه‌ای ضعیف‌تر از این تجربه را دریافت می‌کنند.

OmniVoice چگونه می‌تواند معادله را تغییر دهد

شیائومی می‌گوید OmniVoice با محوریت سنتز گفتار چندزبانه طراحی شده است. این شرکت آن را یک مدل TTS برای شبیه‌سازی صدا توصیف می‌کند که از صدها زبان، از جمله زبان‌هایی با مواد آموزشی بسیار محدود در فضای آنلاین، پشتیبانی می‌کند. در عمل، این یعنی سیستم قرار است حتی زمانی که داده کم است، گفتاری قابل‌فهم و طبیعی تولید کند؛ چالشی که سال‌ها توسعه هوش مصنوعی گفتار را برای زبان‌های منطقه‌ای و کم‌کاربرد کند کرده است.

به گفته شیائومی، این مدل در آزمون‌های 24 زبان، به‌ویژه در شباهت صدا و قابل‌فهم بودن، از چندین سیستم تجاری بهتر عمل کرده است، آن هم در حالی که فقط با مجموعه‌داده‌های متن‌باز آموزش دیده بود. در ارزیابی گسترده‌تری که 102 زبان را پوشش می‌داد، شرکت می‌گوید OmniVoice به سطح قابل‌فهمی در حد انسان نزدیک شد و در برخی موارد حتی از آن فراتر رفت. البته چنین ادعایی به تأیید مستقل نیاز دارد، اما نشان می‌دهد شیائومی تا چه اندازه می‌خواهد این مدل را در رقابت جهانی هوش مصنوعی برجسته کند.

یکی از بخش‌های جالب این اعلامیه، تأکید بر آموزش با داده کم است. شیائومی می‌گوید حتی زبان‌هایی که کمتر از 10 ساعت داده در دسترس دارند هم می‌توانند به سنتز گفتار باکیفیت برسند. برای جوامع و توسعه‌دهندگانی که با زبان‌های کمترنمایان کار می‌کنند، شاید همین مهم‌ترین خبر باشد. مدلی که مانع داده را پایین می‌آورد، از همان ابتدا مشخص می‌کند چه کسانی می‌توانند ابزارهای گفتاری بسازند.

در لایه فنی، OmniVoice مسیر متفاوتی نسبت به بسیاری از پایپ‌لاین‌های پیچیده امروزی TTS در پیش می‌گیرد. به‌جای چیدن چندین ماژول و مرحله پیش‌بینی روی هم، شیائومی می‌گوید از یک شبکه ترنسفورمر دوطرفه واحد استفاده می‌کند تا متن را مستقیماً به گفتار تبدیل کند. معماری ساده‌تر. اجزای متحرک کمتر. و به‌احتمال زیاد گلوگاه‌های کمتر.

این طراحی به سرعت هم گره خورده است. شیائومی ادعا می‌کند OmniVoice می‌تواند روی 100,000 ساعت داده در یک روز آموزش ببیند و هنگام استنتاج، در PyTorch تا 40 برابر سریع‌تر از زمان واقعی اجرا شود. برای توسعه‌دهندگان، این موضوع اهمیت زیادی دارد. استنتاج سریع اغلب همان تفاوتی است که یک دموی چشمگیر را از محصولی جدا می‌کند که واقعاً می‌تواند در ابزارهای مصرفی، سامانه‌های پشتیبانی مشتری، ابزارهای دسترس‌پذیری یا پلتفرم‌های محتوایی استفاده شود.

این شرکت دو انتخاب فنی را عامل این پیشرفت‌ها می‌داند. نخست، چیزی که آن را راهبرد ماسک‌گذاری تصادفی کاملِ کدبوک می‌نامد و گفته می‌شود هم کارایی و هم عملکرد کلی مدل را در زمان آموزش بهبود می‌دهد. دوم، استفاده از یک مدل زبانی بزرگ در پیش‌آموزش است؛ اقدامی که شیائومی می‌گوید به بهبود تلفظ و قابل‌فهم بودن در چارچوب TTS غیرخودبازگشتی کمک می‌کند. به زبان ساده، مدل فقط نمی‌خواهد روان به نظر برسد. می‌خواهد ساختار زبان را آن‌قدر خوب بفهمد که واژه‌های دشوار را طبیعی‌تر تلفظ کند.

این موضوع در دنیای واقعی اهمیت بیشتری پیدا می‌کند، جایی که سنتز گفتار معمولاً روی نام‌ها، لهجه‌ها، واژه‌های قرضی یا متن‌های ترکیبی از چند زبان دچار مشکل می‌شود. شیائومی می‌گوید OmniVoice در این بخش هم کنترل بیشتری به کاربران می‌دهد. تلفظ‌های دشوار، از جمله نویسه‌های چندآوایی چینی و اسامی خاص انگلیسی، را می‌توان به‌صورت دستی اصلاح کرد تا قابلیت اطمینان بالاتر برود.

ویژگی‌های رو‌به‌کاربر جایی هستند که OmniVoice از یک مقاله پژوهشی فاصله می‌گیرد و بیشتر شبیه یک پلتفرم می‌شود. کاربران می‌توانند با توصیف ویژگی‌هایی مانند سن، جنسیت، زیر و بمی صدا، لهجه، گویش و سبک گفتار، صداهای سفارشی بسازند. این مدل همچنین می‌تواند صداهای نجوا و دیگر سبک‌های صوتی ویژه را بدون نیاز به نمونه صوتی مرجع تولید کند، قابلیتی که از نظر انعطاف‌پذیری یک جهش قابل‌توجه است.

شیائومی همچنین می‌گوید مدل می‌تواند پیش از شبیه‌سازی صدا، فایل صوتی مرجعِ نویزی را پاک‌سازی کند و ویژگی‌های گوینده را از ضبط‌هایی که در محیط‌های غیرایده‌آل انجام شده‌اند، شفاف‌تر استخراج کند. شاید این موضوع در نگاه اول جزئی به نظر برسد، اما هر کسی که با صوت واقعی کار کرده باشد می‌داند که مواد اولیه معمولاً چقدر آشفته‌اند. یک سیستم شبیه‌سازی صدا که بتواند از پس نویز پس‌زمینه برآید، بسیار کاربردی‌تر از سیستمی است که فقط در شرایط استودیویی جواب می‌دهد.

بعد نوبت به بیان‌پذیری می‌رسد. OmniVoice از کنترل‌های آهنگ و لحن پشتیبانی می‌کند، از جمله جلوه‌هایی مثل خنده و آه، که می‌تواند گفتار مصنوعی را کمتر رباتیک و بیشتر محاوره‌ای کند. بازار هم دقیقاً به همین سمت می‌رود. نسل بعدی هوش مصنوعی صوتی فقط درباره خواندن دقیق متن با صدای بلند نیست. درباره اجرا، شخصیت و ظرافت احساسی هم هست.

شیائومی نخستین شرکتی نیست که چنین هدفی را دنبال می‌کند و آخرین هم نخواهد بود. اما با متن‌باز کردن OmniVoice، یک سرمایه‌گذاری راهبردی انجام می‌دهد؛ این‌که دسترسی گسترده‌تر توسعه‌دهندگان می‌تواند به گسترش فناوری گفتار این شرکت در محصولات، بازارها و زبان‌های بیشتر کمک کند. اگر این مدل حتی بخشی از وعده‌های شیائومی را عملی کند، OmniVoice می‌تواند به یکی از جذاب‌ترین عرضه‌های متن‌باز هوش مصنوعی صوتی در سال جاری تبدیل شود.

کامران تهرانی
"رویدادهای مهم حوزه فناوری و فرهنگ دیجیتال را پیگیری می‌کنم و سعی می‌کنم با زبانی قابل‌فهم تحولات پیچیده را برای عموم توضیح دهم."

نظر بگذارید

نظرات (5)

پروکُد

خوبه که روی تلفظ اسم‌ها و نویسه‌های چندآوایی هم فکر کردن، چون همین چیزای ریز کل تجربه رو خراب می‌کنه.

کوین‌پالس

بازار TTS داره از «فقط واضح بخون» می‌ره سمت شخصیت و لحن. شیائومی اینو خوب گرفته، حالا باید دید کیفیتش تو عمل چقدره

data.x

40 برابر سریع‌تر از زمان واقعی؟! این یکی بوی تبلیغ می‌ده، ولی اگه درست باشه خیلی خفن می‌شه.

آرمان

متن‌باز شدنش از خود مدل هم مهم‌تره، مخصوصا برای زبان‌های کم‌منبع. این بخشش خیلی امیدوارکننده‌ست.

میدان‌صدا

اگه واقعاً با کمتر از ۱۰ ساعت داده هم جواب بده، یه جهش جدیه. ولی خب فعلاً باید دید بیرون از دمو چی کار می‌کنه...