جستجوی زندهٔ گوگل: گفت وگوی تصویری و صوتی با هوش مصنوعی

نگاهی جامع به «جستجوی زنده» گوگل: ترکیب دوربین و صوت با مدل چندزبانهٔ Gemini 3.1 برای پاسخ‌دهی آنی. مزایا، محدودیت‌ها، مقیاس جهانی و تأثیر بر جستجوی تصویری و مکالمه‌ای را بررسی می‌کنیم.

.
جستجوی زندهٔ گوگل: گفت وگوی تصویری و صوتی با هوش مصنوعی

5 دقیقه

دنبال کردن در گوگل

شما دوربین گوشی را به سوی چیزی می‌گیرید—یک دوچرخه، یک ماشین لباس‌شویی یا یک ابزار تصادفی—و فقط می‌پرسید. هیچ تایپ کردن یا اسکرول کردن لازم نیست. تلاش اخیر گوگل می‌خواهد که جستجو کمتر شبیه یک کادر پرسش و بیشتر شبیه یک گفت‌وگوی بلادرنگ با اینترنت احساس شود. این رویکرد جدید ترکیبی از جستجوی تصویری، جستجوی صوتی و رابط مکالمه‌ای است که تجربه کاربری را ساده و طبیعی‌تر می‌کند.

قابلیت «جستجوی زنده» (Search Live)، که مبتنی بر هوش مصنوعی و مکالمه‌ای طراحی شده، اکنون به‌صورت پنهان در بیش از 200 کشور در دسترس است و از 98 زبان پشتیبانی می‌کند. این ابزار که ابتدا اواخر 2025 در ایالات متحده عرضه شد، ورودی دوربین، تعامل صوتی و پاسخ‌های تولیدشده توسط هوش مصنوعی را در یک تجربهٔ یکپارچه می‌آمیزد؛ تجربه‌ای که کمتر «جستجو» است و بیشتر «گفت‌وگو با اینترنت» به نظر می‌رسد. گسترش جهانی و پشتیبانی از زبان‌های متعدد، این فناوری را برای کاربردهای روزمره و تجاری مناسب‌تر می‌کند.

عملکرد در عمل به این صورت است: اپلیکیشن گوگل را باز کنید، دکمهٔ «زنده» (Live) را لمس کنید و دوربین را نشانه بگیرید. سپس سؤال خود را بلند بپرسید—این دستگاه چه مدلی است، چگونه کار می‌کند، یا دقیقاً چه چیزی را می‌بینم؟ سیستم بلافاصله با پاسخ‌های گفتاری همراه با زیرنویس روی صفحه پاسخ می‌دهد. روند مکالمه به همین‌جا ختم نمی‌شود؛ سامانه همچنان گوش می‌دهد و برای دنبال‌سؤالات، روشن‌سازی‌ها یا حتی تغییر جهت در میانهٔ گفتگو آماده است. این تعامل پیوسته، تجربهٔ پرسش و پاسخ را شبیه یک گفت‌وگو انسانی می‌کند و امکان بازجویی تدریجی و کاوش بیشتر را فراهم می‌آورد.

این تجربه توسط مدل صوتی‌محور جدیدی به نام Gemini 3.1 Flash Live تقویت می‌شود؛ مدلی که گوگل آن را ذاتیاً چندزبانه توصیف می‌کند. این نکته از آنچه به نظر می‌رسد مهم‌تر است: به‌جای ترجمهٔ پسینی، مدل به‌گونه‌ای طراحی شده که به‌طور بومی در زبان‌های مختلف فکر و پاسخ دهد، و این موضوع به کاهش تأخیر و جلوگیریک از عبارات نامأنوس کمک می‌کند. نتیجه: پاسخ‌های سریع‌تر و ریتم گفت‌وگویی طبیعتی‌تر که احساس زمان واقعی را تقویت می‌کند. این مدل همچنین برای مدیریت تبدیل گفتار به متن، فهم زمینهٔ تصویری و حفظ جریان مکالمه بهینه‌سازی شده است.

کجا بهتر عمل می‌کند و کجا ضعف دارد

در لایه‌های فنی، جستجوی زنده به تکنیکی موسوم به query fan-out متکی است. به‌جای پاسخ دادن به یک سؤال به‌صورت ایزوله، سیستم از پرسش‌های مرتبط، زمینه‌های مجاور و منابع مختلف اطلاعاتی استفاده می‌کند تا پاسخی غنی‌تر و کاوش‌محور بسازد. به همین دلیل است که پاسخ‌ها اغلب کمتر صَلب و بیشتر اکتشافی به‌نظر می‌رسند، حتی وقتی خود سؤال ساده باشد. این روش به شناسایی بهتر اشیاء، تحلیل ویژگی‌های ظاهری و ارائهٔ اطلاعات تکمیلی مانند مشخصات فنی، قیمت تقریبی و پیشنهادهای مشابه کمک می‌کند.

با این حال، این ابزار بی‌نقص نیست. در آزمایش‌های عملی، ابزار به‌درستی اشیایی مانند مدل خاص یک دوچرخه را شناسایی کرد و جزئیاتی از قبیل نوع رنگ‌آمیزی یا پرداخت بدنه را توضیح داد. سپس دچار خطا شد: اصلاحات پس از فروش (aftermarket)، تغییرات سفارشی و لوازم جانبی اضافه‌شده را نادیده گرفت یا اشتباه خواند، و گاهی به مفروضات قدیمی دربارهٔ پیکربندی اولیهٔ محصول بازمی‌گشت. این نوع خطاها نشان می‌دهد که سیستم در تشخیص تغییرات ظریف یا عناصر غیرمعمول هنوز جای پیشرفت دارد.

الگوی مشابهی در موارد دیگر نیز دیده شد. برای نمونه، یک مدل جدید گوشی هوشمند با نمونهٔ قدیمی‌تر اشتباه گرفته شد و زمانی که پاسخ‌ها با Gemini Live مقایسه شدند، تقریباً یکسان بودند—که نشان می‌دهد هر دو ابزار بر منابع دادهٔ زیربنایی مشابهی تکیه دارند. این موضوع بر نقش کیفیت و تازگی داده‌های آموزشی و منابع اینترنتی در دقت نهایی تأکید می‌کند. از سوی دیگر، برای کاربردهای روزمره مثل تشخیص اجسام رایج، توضیحات کارکردی و دریافت نکات سریع، سیستم عملکرد قابل قبولی دارد.

این شکاف‌ها چندان شگفت‌آور نیستند. سامانه‌های مبتنی بر هوش مصنوعی مانند این، به‌طور چشمگیری به اطلاعات موجود در وب و مجموعه‌های دادهٔ آموزشی وابسته‌اند؛ بنابراین محصولات کاملاً جدید، نسخه‌های محدود یا آیتم‌های بسیار سفارشی می‌توانند موجب اشتباه شوند. افزون بر این، کیفیت تصاویر، زاویهٔ دید دوربین و نور محیطی هم می‌تواند بر دقت تشخیص تأثیر بگذارد. با این حال، برای سوالات روزمره، تشخیص عمومی اشیاء و راهنمایی‌های سریع، این فناوری عملکرد مستحکمی نشان می‌دهد و می‌تواند بهره‌وری کاربران را افزایش دهد.

جالب‌ترین بخش این عرضه در مقیاس آن نهفته است، نه فقط در ویژگی‌های فنی. گوگل اعلام کرده که بیش از 1.5 میلیارد نفر تا میانهٔ 2025 از Google Lens استفاده کرده‌اند و Gemini Live حدود 750 میلیون کاربر داشته است. «جستجوی زنده» دقیقاً در تقاطع این دو رفتار قرار دارد: دیدن و پرسیدن؛ ترکیبی که می‌تواند تجربهٔ جستجو را از یک عمل آگاهانهٔ جداگانه به یک تعامل طبیعی در لحظه تبدیل کند. این مقیاس بزرگ همچنین فرصت‌های گسترده‌ای برای بهینه‌سازی سئو تصویری، بازاریابی تصویری و تجارت الکترونیک مبتنی بر دیداری فراهم می‌آورد.

اگر این فناوری در سطح جهانی پذیرفته شود، می‌تواند نحوهٔ تعامل کاربران با «جستجو» را کاملاً تغییر دهد: کمتر تایپ، بیشتر صحبت؛ و شاید در آینده، خودِ مفهوم «جستجو» به‌عنوان یک اقدام جداگانه کم‌رنگ‌تر شود و تبدیل به بخشی نامحسوس از تجربهٔ روزمرهٔ کاربران گردد. در کنار این تغییرات، مسائل مرتبط با حریم خصوصی، نگهداری داده‌ها، سوگیری‌های مدل و شفافیت نتایج نیز باید به‌دقت مدیریت شوند تا اعتماد کاربران و دقت اطلاعات حفظ شود.

سارا حسینی
"من تازه‌ترین خبرهای دنیای فناوری را پوشش می‌دهم؛ از رونمایی محصولات تا تحولات شرکت‌ها. هدفم این است که خبر را سریع، واضح و بدون اغراق به خواننده منتقل کنم."

نظر بگذارید

نظرات

هنوز نظری ثبت نشده. اولین نفر باشید.