5 دقیقه
شما دوربین گوشی را به سوی چیزی میگیرید—یک دوچرخه، یک ماشین لباسشویی یا یک ابزار تصادفی—و فقط میپرسید. هیچ تایپ کردن یا اسکرول کردن لازم نیست. تلاش اخیر گوگل میخواهد که جستجو کمتر شبیه یک کادر پرسش و بیشتر شبیه یک گفتوگوی بلادرنگ با اینترنت احساس شود. این رویکرد جدید ترکیبی از جستجوی تصویری، جستجوی صوتی و رابط مکالمهای است که تجربه کاربری را ساده و طبیعیتر میکند.
قابلیت «جستجوی زنده» (Search Live)، که مبتنی بر هوش مصنوعی و مکالمهای طراحی شده، اکنون بهصورت پنهان در بیش از 200 کشور در دسترس است و از 98 زبان پشتیبانی میکند. این ابزار که ابتدا اواخر 2025 در ایالات متحده عرضه شد، ورودی دوربین، تعامل صوتی و پاسخهای تولیدشده توسط هوش مصنوعی را در یک تجربهٔ یکپارچه میآمیزد؛ تجربهای که کمتر «جستجو» است و بیشتر «گفتوگو با اینترنت» به نظر میرسد. گسترش جهانی و پشتیبانی از زبانهای متعدد، این فناوری را برای کاربردهای روزمره و تجاری مناسبتر میکند.
عملکرد در عمل به این صورت است: اپلیکیشن گوگل را باز کنید، دکمهٔ «زنده» (Live) را لمس کنید و دوربین را نشانه بگیرید. سپس سؤال خود را بلند بپرسید—این دستگاه چه مدلی است، چگونه کار میکند، یا دقیقاً چه چیزی را میبینم؟ سیستم بلافاصله با پاسخهای گفتاری همراه با زیرنویس روی صفحه پاسخ میدهد. روند مکالمه به همینجا ختم نمیشود؛ سامانه همچنان گوش میدهد و برای دنبالسؤالات، روشنسازیها یا حتی تغییر جهت در میانهٔ گفتگو آماده است. این تعامل پیوسته، تجربهٔ پرسش و پاسخ را شبیه یک گفتوگو انسانی میکند و امکان بازجویی تدریجی و کاوش بیشتر را فراهم میآورد.
این تجربه توسط مدل صوتیمحور جدیدی به نام Gemini 3.1 Flash Live تقویت میشود؛ مدلی که گوگل آن را ذاتیاً چندزبانه توصیف میکند. این نکته از آنچه به نظر میرسد مهمتر است: بهجای ترجمهٔ پسینی، مدل بهگونهای طراحی شده که بهطور بومی در زبانهای مختلف فکر و پاسخ دهد، و این موضوع به کاهش تأخیر و جلوگیریک از عبارات نامأنوس کمک میکند. نتیجه: پاسخهای سریعتر و ریتم گفتوگویی طبیعتیتر که احساس زمان واقعی را تقویت میکند. این مدل همچنین برای مدیریت تبدیل گفتار به متن، فهم زمینهٔ تصویری و حفظ جریان مکالمه بهینهسازی شده است.

کجا بهتر عمل میکند و کجا ضعف دارد
در لایههای فنی، جستجوی زنده به تکنیکی موسوم به query fan-out متکی است. بهجای پاسخ دادن به یک سؤال بهصورت ایزوله، سیستم از پرسشهای مرتبط، زمینههای مجاور و منابع مختلف اطلاعاتی استفاده میکند تا پاسخی غنیتر و کاوشمحور بسازد. به همین دلیل است که پاسخها اغلب کمتر صَلب و بیشتر اکتشافی بهنظر میرسند، حتی وقتی خود سؤال ساده باشد. این روش به شناسایی بهتر اشیاء، تحلیل ویژگیهای ظاهری و ارائهٔ اطلاعات تکمیلی مانند مشخصات فنی، قیمت تقریبی و پیشنهادهای مشابه کمک میکند.
با این حال، این ابزار بینقص نیست. در آزمایشهای عملی، ابزار بهدرستی اشیایی مانند مدل خاص یک دوچرخه را شناسایی کرد و جزئیاتی از قبیل نوع رنگآمیزی یا پرداخت بدنه را توضیح داد. سپس دچار خطا شد: اصلاحات پس از فروش (aftermarket)، تغییرات سفارشی و لوازم جانبی اضافهشده را نادیده گرفت یا اشتباه خواند، و گاهی به مفروضات قدیمی دربارهٔ پیکربندی اولیهٔ محصول بازمیگشت. این نوع خطاها نشان میدهد که سیستم در تشخیص تغییرات ظریف یا عناصر غیرمعمول هنوز جای پیشرفت دارد.
الگوی مشابهی در موارد دیگر نیز دیده شد. برای نمونه، یک مدل جدید گوشی هوشمند با نمونهٔ قدیمیتر اشتباه گرفته شد و زمانی که پاسخها با Gemini Live مقایسه شدند، تقریباً یکسان بودند—که نشان میدهد هر دو ابزار بر منابع دادهٔ زیربنایی مشابهی تکیه دارند. این موضوع بر نقش کیفیت و تازگی دادههای آموزشی و منابع اینترنتی در دقت نهایی تأکید میکند. از سوی دیگر، برای کاربردهای روزمره مثل تشخیص اجسام رایج، توضیحات کارکردی و دریافت نکات سریع، سیستم عملکرد قابل قبولی دارد.
این شکافها چندان شگفتآور نیستند. سامانههای مبتنی بر هوش مصنوعی مانند این، بهطور چشمگیری به اطلاعات موجود در وب و مجموعههای دادهٔ آموزشی وابستهاند؛ بنابراین محصولات کاملاً جدید، نسخههای محدود یا آیتمهای بسیار سفارشی میتوانند موجب اشتباه شوند. افزون بر این، کیفیت تصاویر، زاویهٔ دید دوربین و نور محیطی هم میتواند بر دقت تشخیص تأثیر بگذارد. با این حال، برای سوالات روزمره، تشخیص عمومی اشیاء و راهنماییهای سریع، این فناوری عملکرد مستحکمی نشان میدهد و میتواند بهرهوری کاربران را افزایش دهد.
جالبترین بخش این عرضه در مقیاس آن نهفته است، نه فقط در ویژگیهای فنی. گوگل اعلام کرده که بیش از 1.5 میلیارد نفر تا میانهٔ 2025 از Google Lens استفاده کردهاند و Gemini Live حدود 750 میلیون کاربر داشته است. «جستجوی زنده» دقیقاً در تقاطع این دو رفتار قرار دارد: دیدن و پرسیدن؛ ترکیبی که میتواند تجربهٔ جستجو را از یک عمل آگاهانهٔ جداگانه به یک تعامل طبیعی در لحظه تبدیل کند. این مقیاس بزرگ همچنین فرصتهای گستردهای برای بهینهسازی سئو تصویری، بازاریابی تصویری و تجارت الکترونیک مبتنی بر دیداری فراهم میآورد.
اگر این فناوری در سطح جهانی پذیرفته شود، میتواند نحوهٔ تعامل کاربران با «جستجو» را کاملاً تغییر دهد: کمتر تایپ، بیشتر صحبت؛ و شاید در آینده، خودِ مفهوم «جستجو» بهعنوان یک اقدام جداگانه کمرنگتر شود و تبدیل به بخشی نامحسوس از تجربهٔ روزمرهٔ کاربران گردد. در کنار این تغییرات، مسائل مرتبط با حریم خصوصی، نگهداری دادهها، سوگیریهای مدل و شفافیت نتایج نیز باید بهدقت مدیریت شوند تا اعتماد کاربران و دقت اطلاعات حفظ شود.






نظر بگذارید
نظرات
هنوز نظری ثبت نشده. اولین نفر باشید.