5 دقیقه
هوش مصنوعی صوتی عادت دارد روی کاغذ شگفتانگیز به نظر برسد و در عمل، بهطرزی عجیب بیروح باشد. شیائومی فکر میکند برای این مشکل راهحلی دارد. این شرکت مدل OmniVoice را متنباز کرده است؛ یک مدل جدید تبدیل متن به گفتار که برای شبیهسازی صدا، تولید گفتار چندزبانه و کنترل دقیق روی اینکه صدای مصنوعی واقعاً چگونه شنیده شود، ساخته شده است.
آنچه این عرضه را متمایز میکند فقط وعده همیشگیِ گفتار تمیزتر یا خروجی سریعتر نیست. شیائومی OmniVoice را بهعنوان مدلی معرفی میکند که میتواند در صدها زبان کار کند، از جمله زبانهای کممنبعی که معمولاً در سیستمهای گفتار جریان اصلی نادیده گرفته میشوند. اگر این ادعا فراتر از نمایشهای آزمایشگاهی هم دوام بیاورد، میتواند اهمیت آن بسیار فراتر از گوشیهای پرچمدار و دستیارهای هوشمند باشد.
این اعلامیه از طریق کانال رسمی ویچت شیائومی منتشر شد؛ جایی که شرکت گفت OmniVoice در زبانهای چینی و انگلیسی عملکرد بسیار خوبی دارد و در برخی وظایف چندزبانه، میتواند با گزینههای تجاری برابری کند یا حتی از آنها بهتر باشد. این ادعای بزرگی است. اما جزئیات نشان میدهد که شیائومی یک نقطه درد واقعی در فناوری گفتار را هدف گرفته است: بیشتر سیستمهای تبدیل متن به گفتار هنوز در چند زبان اصلی بهترین عملکرد را دارند، در حالی که بقیه زبانها نسخهای ضعیفتر از این تجربه را دریافت میکنند.
OmniVoice چگونه میتواند معادله را تغییر دهد
شیائومی میگوید OmniVoice با محوریت سنتز گفتار چندزبانه طراحی شده است. این شرکت آن را یک مدل TTS برای شبیهسازی صدا توصیف میکند که از صدها زبان، از جمله زبانهایی با مواد آموزشی بسیار محدود در فضای آنلاین، پشتیبانی میکند. در عمل، این یعنی سیستم قرار است حتی زمانی که داده کم است، گفتاری قابلفهم و طبیعی تولید کند؛ چالشی که سالها توسعه هوش مصنوعی گفتار را برای زبانهای منطقهای و کمکاربرد کند کرده است.
به گفته شیائومی، این مدل در آزمونهای 24 زبان، بهویژه در شباهت صدا و قابلفهم بودن، از چندین سیستم تجاری بهتر عمل کرده است، آن هم در حالی که فقط با مجموعهدادههای متنباز آموزش دیده بود. در ارزیابی گستردهتری که 102 زبان را پوشش میداد، شرکت میگوید OmniVoice به سطح قابلفهمی در حد انسان نزدیک شد و در برخی موارد حتی از آن فراتر رفت. البته چنین ادعایی به تأیید مستقل نیاز دارد، اما نشان میدهد شیائومی تا چه اندازه میخواهد این مدل را در رقابت جهانی هوش مصنوعی برجسته کند.
یکی از بخشهای جالب این اعلامیه، تأکید بر آموزش با داده کم است. شیائومی میگوید حتی زبانهایی که کمتر از 10 ساعت داده در دسترس دارند هم میتوانند به سنتز گفتار باکیفیت برسند. برای جوامع و توسعهدهندگانی که با زبانهای کمترنمایان کار میکنند، شاید همین مهمترین خبر باشد. مدلی که مانع داده را پایین میآورد، از همان ابتدا مشخص میکند چه کسانی میتوانند ابزارهای گفتاری بسازند.
در لایه فنی، OmniVoice مسیر متفاوتی نسبت به بسیاری از پایپلاینهای پیچیده امروزی TTS در پیش میگیرد. بهجای چیدن چندین ماژول و مرحله پیشبینی روی هم، شیائومی میگوید از یک شبکه ترنسفورمر دوطرفه واحد استفاده میکند تا متن را مستقیماً به گفتار تبدیل کند. معماری سادهتر. اجزای متحرک کمتر. و بهاحتمال زیاد گلوگاههای کمتر.
این طراحی به سرعت هم گره خورده است. شیائومی ادعا میکند OmniVoice میتواند روی 100,000 ساعت داده در یک روز آموزش ببیند و هنگام استنتاج، در PyTorch تا 40 برابر سریعتر از زمان واقعی اجرا شود. برای توسعهدهندگان، این موضوع اهمیت زیادی دارد. استنتاج سریع اغلب همان تفاوتی است که یک دموی چشمگیر را از محصولی جدا میکند که واقعاً میتواند در ابزارهای مصرفی، سامانههای پشتیبانی مشتری، ابزارهای دسترسپذیری یا پلتفرمهای محتوایی استفاده شود.
این شرکت دو انتخاب فنی را عامل این پیشرفتها میداند. نخست، چیزی که آن را راهبرد ماسکگذاری تصادفی کاملِ کدبوک مینامد و گفته میشود هم کارایی و هم عملکرد کلی مدل را در زمان آموزش بهبود میدهد. دوم، استفاده از یک مدل زبانی بزرگ در پیشآموزش است؛ اقدامی که شیائومی میگوید به بهبود تلفظ و قابلفهم بودن در چارچوب TTS غیرخودبازگشتی کمک میکند. به زبان ساده، مدل فقط نمیخواهد روان به نظر برسد. میخواهد ساختار زبان را آنقدر خوب بفهمد که واژههای دشوار را طبیعیتر تلفظ کند.
این موضوع در دنیای واقعی اهمیت بیشتری پیدا میکند، جایی که سنتز گفتار معمولاً روی نامها، لهجهها، واژههای قرضی یا متنهای ترکیبی از چند زبان دچار مشکل میشود. شیائومی میگوید OmniVoice در این بخش هم کنترل بیشتری به کاربران میدهد. تلفظهای دشوار، از جمله نویسههای چندآوایی چینی و اسامی خاص انگلیسی، را میتوان بهصورت دستی اصلاح کرد تا قابلیت اطمینان بالاتر برود.
ویژگیهای روبهکاربر جایی هستند که OmniVoice از یک مقاله پژوهشی فاصله میگیرد و بیشتر شبیه یک پلتفرم میشود. کاربران میتوانند با توصیف ویژگیهایی مانند سن، جنسیت، زیر و بمی صدا، لهجه، گویش و سبک گفتار، صداهای سفارشی بسازند. این مدل همچنین میتواند صداهای نجوا و دیگر سبکهای صوتی ویژه را بدون نیاز به نمونه صوتی مرجع تولید کند، قابلیتی که از نظر انعطافپذیری یک جهش قابلتوجه است.
شیائومی همچنین میگوید مدل میتواند پیش از شبیهسازی صدا، فایل صوتی مرجعِ نویزی را پاکسازی کند و ویژگیهای گوینده را از ضبطهایی که در محیطهای غیرایدهآل انجام شدهاند، شفافتر استخراج کند. شاید این موضوع در نگاه اول جزئی به نظر برسد، اما هر کسی که با صوت واقعی کار کرده باشد میداند که مواد اولیه معمولاً چقدر آشفتهاند. یک سیستم شبیهسازی صدا که بتواند از پس نویز پسزمینه برآید، بسیار کاربردیتر از سیستمی است که فقط در شرایط استودیویی جواب میدهد.
بعد نوبت به بیانپذیری میرسد. OmniVoice از کنترلهای آهنگ و لحن پشتیبانی میکند، از جمله جلوههایی مثل خنده و آه، که میتواند گفتار مصنوعی را کمتر رباتیک و بیشتر محاورهای کند. بازار هم دقیقاً به همین سمت میرود. نسل بعدی هوش مصنوعی صوتی فقط درباره خواندن دقیق متن با صدای بلند نیست. درباره اجرا، شخصیت و ظرافت احساسی هم هست.
شیائومی نخستین شرکتی نیست که چنین هدفی را دنبال میکند و آخرین هم نخواهد بود. اما با متنباز کردن OmniVoice، یک سرمایهگذاری راهبردی انجام میدهد؛ اینکه دسترسی گستردهتر توسعهدهندگان میتواند به گسترش فناوری گفتار این شرکت در محصولات، بازارها و زبانهای بیشتر کمک کند. اگر این مدل حتی بخشی از وعدههای شیائومی را عملی کند، OmniVoice میتواند به یکی از جذابترین عرضههای متنباز هوش مصنوعی صوتی در سال جاری تبدیل شود.






نظر بگذارید
نظرات (5)
خوبه که روی تلفظ اسمها و نویسههای چندآوایی هم فکر کردن، چون همین چیزای ریز کل تجربه رو خراب میکنه.
بازار TTS داره از «فقط واضح بخون» میره سمت شخصیت و لحن. شیائومی اینو خوب گرفته، حالا باید دید کیفیتش تو عمل چقدره
40 برابر سریعتر از زمان واقعی؟! این یکی بوی تبلیغ میده، ولی اگه درست باشه خیلی خفن میشه.
متنباز شدنش از خود مدل هم مهمتره، مخصوصا برای زبانهای کممنبع. این بخشش خیلی امیدوارکنندهست.
اگه واقعاً با کمتر از ۱۰ ساعت داده هم جواب بده، یه جهش جدیه. ولی خب فعلاً باید دید بیرون از دمو چی کار میکنه...