4 دقیقه
آزاردهندهترین بخش استفاده از هوش مصنوعی روی کامپیوتر خودِ هوش مصنوعی نیست. مشکل، وقفههای پیدرپی است. وسط کار متوقف میشوید، وارد یک چتبات میشوید، توضیح میدهید روی صفحه چه میبینید، پاسخ را کپی میکنید و بعد دوباره برمیگردید سراغ کاری که انجام میدادید. حالا گوگل دیپمایند میخواهد این اصطکاک را با یک ایده ساده اما شگفتانگیز و جسورانه حذف کند: نشانگر ماوس را هوشمند کند.
در مجموعهای تازه از دموها و پیشنمایشهای پژوهشی، دیپمایند نشان میدهد که چگونه یک نشانگر مبتنی بر جمینای میتواند هم تشخیص دهد مقصد شما کجاست و هم بفهمد زیر آن چه چیزی قرار دارد. این موضوع تعامل را بهطور کامل تغییر میدهد. بهجای نوشتن یک پرامپت طولانی، به چیزی اشاره میکنید و نتیجهای را که میخواهید درخواست میکنید. سیستم، زمینه بصری و معنایی اطراف را خودش میخواند.
این تغییر شاید کوچک به نظر برسد، اما کوچک نیست. این کار، نشانگر ماوس را از یک ابزار منفعل ناوبری به یک لایه فعال از کمکگرفتن از هوش مصنوعی تبدیل میکند؛ لایهای که دقیقاً همانجایی حضور دارد که توجه شما از قبل روی آن متمرکز است.
تصور کنید روی یک جدول دادهها میروید و درخواست یک نمودار دایرهای میدهید. یا روی یک دستور پخت اشاره میکنید و میگویید: «این مواد را دو برابر کن.» یک فایل PDF میتواند به فهرستی مرتب از نکات تبدیل شود که برای ایمیل آماده است. اگر ویدیوی سفر را روی نمایی از یک رستوران متوقف کنید، سیستم میتواند لینک رزرو را پیدا کند. در همه این حالتها، وعده یکی است: توضیح کمتر، جابهجایی کمتر بین برنامهها، و ویرایش دستی کمتر.
دیپمایند این رویکرد را حرکتی به سمت «خلاصهگویی طبیعی» توصیف میکند. این عبارت مهم است. برای سالها، ابزارهای هوش مصنوعی از کاربران میخواستند به نویسندگان ماهر پرامپت تبدیل شوند. این رویکرد آن بار را جابهجا میکند. حالا رایانه بخش بیشتری از کار تفسیر را انجام میدهد و کاربر فقط اشاره میکند و درخواست میدهد.
نشانگر از یک نشانگر ساده فراتر میرود
این ایده فقط در حد آزمایشگاه نیست. گوگل هماکنون دو آزمایش زنده در AI Studio دارد که روی ویرایش تصویر و جستوجوی نقشه متمرکز هستند و یک نگاه اولیه به این میدهند که این مدل تعامل در دنیای واقعی چگونه میتواند کار کند. برنامه گستردهتر از این هم فراتر میرود.
گوگل میگوید این فناوری در راه کروم است؛ جایی که کاربران میتوانند بخشی از محتوا را در یک صفحه وب هایلایت یا انتخاب کنند و بدون تایپ یک توضیح کامل در پنجرهای جداگانه، از جمینای درباره آن بپرسند. این، ادامهای طبیعی برای قابلیتهای هوش مصنوعی است که گوگل از قبل در مرورگر خود ادغام کرده است. برای مثال، Auto Browse اکنون میتواند به جمینای اجازه دهد وظایف چندمرحلهای را در وب انجام دهد.
بعد دیگری هم در سطح سیستمعامل وجود دارد. نسخهای با نام Magic Pointer قرار است روی Googlebook عرضه شود، خط لپتاپ تازه معرفیشده گوگل که بر جمینای تمرکز دارد. اگر این عرضه طبق برنامه انجام شود، این مفهوم فراتر از تبهای مرورگر میرود و وارد تجربه گستردهتر دسکتاپ میشود.
در همین نقطه است که موضوع از یک دمو جذاب فراتر به نظر میرسد. پنلهای کناری و جعبههای چتبات هنوز هم از کاربران میخواهند از جریان کاری خود خارج شوند. یک نشانگر هوش مصنوعی دقیقاً برعکس عمل میکند. کمک را در همان نقطهای نگه میدارد که سؤال در آن ظاهر میشود.
ماوس کامپیوتر بیش از نیمقرن است که در هیچ معنای مهمی تغییر نکرده. هنوز هم همانطور که همیشه بوده کلیک میکند، میکشد، انتخاب میکند و اشاره میکند. ایده دیپمایند جذاب است چون نمیخواهد این رفتار آشنا را حذف کند. بلکه لایهای از درک را روی آن قرار میدهد.
اینکه آیا این قابلیت به یک ویژگی استاندارد در محاسبات مدرن تبدیل میشود یا نه، به نحوه اجرای آن بستگی دارد. هوش مصنوعی آگاه به زمینه قدرتمند به نظر میرسد، اما در عین حال پرسشهای آشنایی درباره دقت، حریم خصوصی و میزان اعتمادی که کاربران به سیستمی دارند که دائماً در حال تفسیر محتوای صفحه است، به همراه میآورد. با این حال، مسیر پیش رو سخت است که نادیده گرفته شود. اگر چتباتها نخستین رابط بزرگ برای هوش مصنوعی مولد بودند، شاید نشانگر ماوس همان رابط بعدی باشد که واقعاً حس بومیبودن برای خودِ کامپیوتر را القا میکند.





نظر بگذارید
نظرات (3)
ایده خوبیه، ولی یهویی همهچیزو AI کنن آخرش کاربر بیشتر گیج میشه یا نه؟
جالب شد، مخصوصاً برای PDF و وب. ولی یه کم میترسم از این که همه چی رو صفحه رو هی تفسیر کنه
اگه واقعاً موس بفهمه چی میخوای، خیلی از این رفتوبرگشتای اعصابخردکن تموم میشه... ولی خب دقتش مهمه، وگرنه دردسرش بیشتره