فناوری پوشیدنی POSTECH برای تبدیل گفتار خاموش به صدا

پژوهشگران POSTECH یک فناوری پوشیدنی مبتنی بر هوش مصنوعی ساخته‌اند که با ردیابی حرکت‌های ظریف گردن، گفتار خاموش را به صدای طبیعی و قابل شنیدن تبدیل می‌کند.

.3 دیدگاه
فناوری پوشیدنی POSTECH برای تبدیل گفتار خاموش به صدا

4 دقیقه

دنبال کردن در گوگل

تصور کنید بدون ایجاد هیچ صدایی صحبت کنید و همچنان دیگران شما را بفهمند. این دیگر فقط یک خیال علمی نیست.

پژوهشگران دانشگاه علوم و فناوری پوهانگ که با نام POSTECH شناخته می‌شود، یک سیستم پوشیدنی توسعه داده‌اند که می‌تواند گفتار خاموش را با ردیابی حرکت‌های بسیار ظریف عضلات و پوست اطراف گردن به صدای قابل شنیدن تبدیل کند. این پژوهش به سرپرستی پروفسور سونگ-مین پارک و دکتر سونگوک هونگ انجام شده و در مجله Cyborg and Bionic Systems منتشر شده است؛ پژوهشی که فصل تازه‌ای را در ارتباط انسان و ماشین نشان می‌دهد.

چگونه یک زمزمه به صدا تبدیل می‌شود

ایده در ظاهر بسیار ساده است. حتی وقتی فردی بلند صحبت نمی‌کند، بدن همچنان حرکت می‌کند. تغییرات ظریف در گردن، فک و پوست اطراف آن، شکل واژه‌های مورد نظر را آشکار می‌کند. این حرکات یک سیگنال فیزیکی ایجاد می‌کنند که قابل ثبت و تفسیر است.

برای انجام این کار، تیم POSTECH یک دستگاه پوشیدنی با نام حسگر نقشه‌برداری کرنش چندمحوره ساخته است. این سامانه از یک دوربین مینیاتوری و سیلیکون انعطاف‌پذیر با نقاط مرجع استفاده می‌کند تا حتی تغییر شکل‌های بسیار جزئی سطح را نیز تشخیص دهد. در عمل، این یعنی حسگر می‌تواند به‌راحتی روی گردن قرار بگیرد، حرکت را با دقت دنبال کند و اگر جابه‌جا شود، خودش دوباره کالیبره شود.

پس از جمع‌آوری داده‌ها، هوش مصنوعی وارد عمل می‌شود. سیستم الگوهای کرنش را می‌خواند، نیت گفتاری را شناسایی می‌کند و واژه‌ها یا حتی جمله‌های کامل را بازسازی می‌کند. سپس این خروجی را با سنتز صوتی که بر اساس ویژگی‌های صوتی خود کاربر آموزش دیده است ترکیب می‌کند و گفتاری تولید می‌شود که طبیعی و کاملاً انسانی به نظر می‌رسد.

دستاورد اصلی فقط این نیست که سیستم می‌تواند سکوت را «بشنود»، بلکه این است که می‌تواند صدای خود گوینده را نیز حفظ کند.

پاسخی سبک‌تر به یک مشکل سرسخت

فناوری بازیابی صدا سال‌هاست که به ابزارهایی مانند الکترومیوگرافی و الکتروانسفالوگرافی متکی بوده است. این سیستم‌ها می‌توانند مؤثر باشند، اما اغلب با مصالحه‌های مشخصی همراه‌اند: سخت‌افزار حجیم، راه‌اندازی دشوار و راحتی محدود برای استفاده روزمره.

در همین نقطه است که رویکرد POSTECH برجسته می‌شود. این سامانه پوشیدنی، سبک و برای استفاده عملی طراحی شده است، نه فقط نمایش‌های آزمایشگاهی. در آزمایش‌ها، سیستم دقت بالایی در بازسازی گفتار نشان داد، حتی در محیط‌های پر سر و صدا که میکروفون‌های معمولی معمولاً در آن‌ها شکست می‌خورند. به‌ویژه محیط‌های صنعتی، میدان آزمونی دشوار هستند و به نظر می‌رسد این فناوری دقیقاً برای چنین چالشی ساخته شده است.

کاربردهای احتمالی آن به‌راحتی قابل تصور است. برای بیمارانی که بر اثر آسیب طناب صوتی یا جراحی حنجره صدای خود را از دست داده‌اند، این فناوری می‌تواند راهی برای برقراری دوباره ارتباط با صدایی نزدیک به صدای طبیعی خودشان فراهم کند. این موضوع کوچک نیست. برای بسیاری از افراد، چنین امکانی می‌تواند زندگی‌شان را تغییر دهد.

اما اثر آن ممکن است بسیار فراتر از حوزه سلامت باشد.

ارتباط خاموش می‌تواند در جلسات، کتابخانه‌ها، مراکز حمل‌ونقل شلوغ یا محیط‌های کاری پر سر و صدا کاربرد داشته باشد، جایی که صحبت کردن با صدای بلند دشوار یا غیرممکن است. همچنین می‌تواند شیوه تعامل انسان با سامانه‌های هوش مصنوعی را تغییر دهد و فرمان‌ها و پاسخ‌ها را کمتر مکانیکی و بیشتر شهودی کند. نه صفحه‌کلید. نه میکروفون. فقط نیت، که به گفتار تبدیل می‌شود.

در حال حاضر، تیم پژوهشی بر افزایش دقت، گسترش پشتیبانی زبانی و سازگارتر کردن سیستم برای استقرار در دنیای واقعی تمرکز دارد. اگر این بخش‌ها کنار هم قرار بگیرند، این نوع هوش مصنوعی پوشیدنی می‌تواند زودتر از آنچه بسیاری انتظار دارند، از یک نمونه اولیه امیدوارکننده به ابزاری روزمره تبدیل شود.

روند کلی را نمی‌توان نادیده گرفت. هوش مصنوعی دارد کمتر دیده می‌شود، شخصی‌تر می‌شود و بیش از پیش در دستگاه‌هایی که می‌پوشیم، ادغام می‌شود. و با نوآوری‌هایی مانند این، حتی واژه‌های ناگفته نیز شاید به‌زودی صاحب صدا شوند.

مهدی بهرامی
"محتوای آموزشی درباره هوش مصنوعی و یادگیری ماشینی تولید می‌کنم، به‌صورتی که برای خواننده عمومی قابل‌فهم باشد و کاربردهای واقعی را نشان دهد."

نظر بگذارید

نظرات (3)

نوا_کس

خوبه، اما خیلی هم نباید هیجان‌زده شد. تا وقتی تو شلوغی و استفاده روزمره تست نشه، هنوز یه قدم تا محصول واقعی فاصله داره.

آرمان

این دیگه از اون تکنولوژی‌هایی‌ه که اولش شوخی به نظر میاد بعد یهو می‌بینی همه جا هست. فقط امیدوارم تو محیط واقعی هم همینقدر خوب جواب بده.

دیتاپالس

واقعاً جالبه، ولی یه کم هم ترسناک به نظر میاد... اگه دقیق کار کنه برای آدمایی که صداشون رو از دست دادن میتونه نجات‌بخش باشه.