9 دقیقه
گوگل بهتازگی بهروزرسانی قابلتوجهی برای هوش مصنوعی Gemini منتشر کرده است که هدف آن ارتقای نحوه تعامل دستیار با گفتگوهای صوتی طبیعی و دوطرفه است. این ارتقاء که با برند Gemini 2.5 Flash Native Audio عرضه شده، تمرکز اصلیاش بر افزایش قابلیت اطمینان و ایجاد تعاملاتی روانتر و انسانگونه برای عوامل صوتی (voice agents) در اکوسیستمهای مختلف گوگل است.
چه چیزی در Gemini 2.5 تغییر کرده است؟
نسخه جدید روی سه بهبود عملیاتی تمرکز دارد که در حین گفتگوهای زنده (live conversations) اهمیت دارند. نخست، Gemini در فراخوانی توابع خارجی (external functions) در زمان مناسب بهتر عمل میکند — یعنی وقتی عامل زنده نیاز به واکشی اطلاعات زمان واقعی دارد، دستیار آن دادهها را بهطور یکپارچه در پاسخ گفتاری وارد میکند بدون اینکه جریان مکالمه قطع یا نامنظم شود. این بهبود روی تماسهای API پویا، واکشی وضعیت لحظهای و هماهنگی با سرویسهای بیرونی اهمیت زیادی دارد.
دوم، پیروی از دستورالعملهای توسعهدهندگان بهبود یافته است: Gemini اکنون حدود 90٪ اوقات از راهنماییهای سفارشی پیروی میکند، که نسبت به 84٪ قبلی افزایش داشته و آن را برای فرمانهای پیچیده و منطقهای سفارشی قابلاعتمادتر میسازد. این معیار نشاندهنده ارتقای قابلتوجه در تبعیت از الگوی دلخواه توسعهدهنده و رفتار تعریفشده برای عوامل صوتی است.
سوم، مدل بهتر از متن (context) های پیشین گفتگو استفاده میکند و پاسخهایی تولید میکند که همراستا، منسجم و پیوسته بهنظر میرسند. بازیابی بافت (context retrieval) بهبود یافته به این معنی است که در مکالمات چندنوبتی (multiturn) حافظه محاورهای مؤثرتر حفظ شده و تکرارها یا پاسخهای نامرتبط کاهش مییابد.
در کنار این موارد، چند اصلاح کوچک اما هدفمند دیگر تجربه کاربر را روانتر میکنند. Gemini Live اکنون کمتر احتمال دارد که در صورت مکث کوتاه کاربر از او قطع صحبت کند، و کاربر میتواند میکروفن را در طول جلسه ساکت کند بدون اینکه بهاشتباه باعث توقف دستیار شود. این اصلاحات کاربرپسند اصطکاک در تعاملات روزمره صوتی را کاهش میدهند — بهویژه زمانی که عوامل صوتی با درخواستهای چندمرحلهای سروکار دارند یا نیاز به واکشی دادههای زنده دارند.

کجا این بهروزرسانی را خواهید دید
- عوامل صوتی Gemini Live و Search Live
- ابزارهای توسعهدهنده مانند Google AI Studio و Vertex AI
- بهبودهای آتی در Google Translate، شامل مدیریت بهتر اصطلاحات، کنایه و افزایش پوشش زبانی در ویژگی Live Translate
بهاختصار، این گامی تدریجی اما مهم در جهت طبیعیتر شدن دستیارهای صوتی است تا کمتر شبیه ابزارهای ازپیشنوشته و بیشتر مانند شریک گفتگوی انسانی بهنظر برسند. چه در حال ساخت تجربههای صوتی در Vertex AI باشید و چه از قابلیتهای زنده Translate استفاده میکنید، بهروزرسانی Gemini 2.5 وعده وقفههای کمتر، فراخوانیهای دادهای هوشمندتر و تبعیت وفادارانهتر از قواعد توسعهدهنده را میدهد. آماده گفتوگو هستید؟
تجزیه و تحلیل فنی توابع خارجی و زمانبندی فراخوانیها
یکی از تغییرات کلیدی در Gemini 2.5 مربوط به مکانیزم فراخوانی توابع خارجی است. بهطور خاص، سیستم اکنون از الگوریتمهایی برای پیشبینی نقطه مناسب در دیالوگ برای انجام فراخوانیهای API استفاده میکند تا کمترین برهمکنش را با جریان گفتار داشته باشد. این کار با ارزیابیِ لحظهای سیگنالهای پاراگرافی مانند توقف کاربر، ساختار دستوری آخرین جمله و احتمال نیاز به دادههای حقیقی انجام میشود.
برای توسعهدهندگان، این بدان معناست که وقتی از Vertex AI یا Google AI Studio استفاده میکنید و تابعی را برای واکشی وضعیت سفارش، وضعیت پرواز یا دادههای مالی متصل میکنید، Gemini تلاش میکند فقط زمانی که احتمالش بالاست کاربر انتظار اطلاعات زنده را دارد، آن تابع را فراخوانی کند. این کاهش فراخوانیهای غیرضروری کمک میکند تا هزینهها و تاخیرهای شبکه کاهش یابد و تجربه کلی (latency) بهتر شود.
چگونگی ارزیابی شرایط فراخوانی
Gemini از ویژگیهای حجمدار (feature signals) مانند زمان مکثِ کاربر، واژگان مورد استفاده، و الگوهای پرسشی برای تصمیمگیری استفاده میکند. همچنین الگوهای توسعهدهنده (developer-provided hints) و قوانین شرطی را در نظر میگیرد تا از فراخوانی بیمورد API جلوگیری کند. این ترکیب از سیگنالها و قوانین باعث میشود که تماس با سرویسهای برونسیستمی به شکلی بهینهتر و با هدفمندی بیشتر انجام شود.
پیروی از دستورالعملهای توسعهدهنده و قابلیت تنظیم
افزایش درصد پیروی از دستورالعملها (از 84% به حدود 90%) نشاندهنده بهبود هر دو جنبه مدل و ابزارهای کنترلی است. در عمل، این بهبود حاصل دو مسیر همزمان است: بهینهسازی مهندسی مدل برای درک بهتر دستورات و ارائه ابزارهای دقیقتر برای توسعهدهندگان تا رفتارهای سفارشی را تعریف و کنترل کنند.
ابزارهایی مانند Google AI Studio و Vertex AI اکنون گزینههای پیشرفتهتری برای تعیین الویتها، قالبهای پاسخ و قواعد اجرایی ارائه میکنند. برای مثال، میتوانید تعیین کنید که در پاسخهای صوتی اطلاعات شخصی و حساس حذف شوند، یا اولویت پاسخدهی به منابع رسمی داده مشخص شود. این سطح از کنترل برای کاربردهای سازمانی و سرویسهای مشتریمحور حیاتی است.
نمونههایی از قوانین توسعهدهنده
- الویتدهی به پاسخهای رسمی سازمانی (Official Source Priority)
- فیلتر کردن اطلاعات حساس در خروجی صوتی
- تعریف قالبهای پاسخ برای موقعیتهای مکالمه پیچیده
حفظ چارچوب محاورهای و بازیابی بافت
در گفتگوهای چندنوبتی، توانایی مدل در یادآوری و استفاده از اطلاعات قبلی بهطور مستقیم روی کیفیت تجربه کاربری تاثیر میگذارد. Gemini 2.5 با بهبود مکانیزمهای ایندکسگذاری و بازیابی بافت، میتواند بهصورت هدفمند بخشهای مرتبط از تاریخچه مکالمه را در حافظه کوتاهمدت حفظ کند و هنگام تولید پاسخ، آنها را وارد فرآیند تولید کند.
این کار نه تنها انسجام را افزایش میدهد، بلکه از بازیابی اطلاعات نامربوط یا تکرار مکرر جلوگیری میکند. برای نمونه، اگر کاربر چند پیام پیاپی درباره یک سفارش یا موضوع خاص فرستاده باشد، Gemini قادر است آن موضوع را تشخیص داده و پاسخهای بعدی را در همان چهارچوب نگه دارد.
پیامدها برای طراحی تجربه کاربری صوتی
برای طراحان UX و مهندسان صدا، این پیشرفت به معنی امکان طراحی جریانهای گفتگو پیچیدهتر است که نیازی به بازپرسکردن مکرر اطلاعات ندارند. بازخورد صوتی میتواند متکیتر، شخصیتر و کمخطاتر باشد که در خدمات مشتری، دستیارهای خانگی و سیستمهای اطلاعرسانی زنده کاربرد زیادی دارد.
تجربه کاربری: مدیریت مکثها و سکوتها
یکی از شکایات رایج در سیستمهای گفتگوی صوتی این است که مدلها با اولین مکث کوتاه کاربر، صحبت را قطع یا پاسخ را ناتمام میگذارند. در Gemini 2.5 این رفتار بهبود یافته و مدل حساسیت کمتری نسبت به مکثهای کوتاه نشان میدهد، در نتیجه کاربر فرصت بیشتری برای ادامه صحبت یا اصلاح جمله خواهد داشت.
همینطور امکان قطع موقت میکروفن (mute) در حین جلسه بدون ایجاد توقف کامل در پردازش دستیار فراهم شده است؛ این قابلیت برای مواردی که کاربر موقتا به دلیل حریم خصوصی یا نیاز به مشورت با شخص دیگری میکروفن را قطع میکند، مفید است.
کجاها و چگونه میتوان از این بهبودها استفاده کرد
این آپدیت در چند حوزه عملی قابلاستفاده است و توسعهدهندگان میتوانند از مزایای آن در سناریوهای مختلف بهره ببرند:
خدمات مشتری صوتی (Voice Customer Support)
در تماسهای پشتیبانی، واکشی دادههای لحظهای щодо سفارشها، تراکنشها یا وضعیت سرویس باید بدون وقفه و با حداقل تاخیر انجام شود. Gemini 2.5 با فراخوانی هوشمند توابع خارجی، میتواند اطلاعات بهروز را در پاسخ صوتی وارد کند و تجربهای انسانیتر برای مشتری فراهم آورد.
دستیارهای خانگی و تجربه کاربری روزمره
برای دستیارهای خانگی که با چندین فرمان متوالی کار میکنند، حفظ بافت و جلوگیری از قطع ناگهانی صحبت کاربر اهمیت دارد. ویژگیهای جدید Gemini باعث میشود تعاملات روزمره مثل تنظیم یادآورها، پخش موسیقی یا کنترل خانه هوشمند طبیعیتر شوند.
ترجمهی زنده و ارتباطات بینزبانی
با بهبودهای اعلامشده برای Google Translate و Live Translate، انتظار میرود که مدیریت اصطلاحات، کنایهها و ساختارهای زبانی پیچیده بهتر شود. این بهخصوص برای محاورههای بینزبانی که شامل زبان محاورهای، اصطلاحات فرهنگی یا کنایه است اهمیت دارد.
ملاحظات امنیتی و حریم خصوصی
هرچند پیشرفتهای Gemini امکانات جدیدی برای تعاملات صوتی فراهم میآورد، اما نگرانیهای مرتبط با حریم خصوصی و امنیت نیز باید مدنظر قرار گیرند. فراخوانی توابع خارجی و واکشی دادههای زنده بهمعنی تعامل با APIهای بیرونی است که ممکن است شامل دادههای حساس باشد. از این رو توصیه میشود:
- از رمزنگاری کانالهای ارتباطی و اعتبارسنجی قوی برای APIها استفاده کنید.
- رویههای حذف یا فیلتر اطلاعات حساس را در لایه پاسخدهی صوتی فعال کنید.
- برای هر تماس به سرویس بیرونی، سیاستهای لاگبرداری و نگهداری داده مشخص تعیین کنید.
مقایسه با دیگر مدلها و مزایای رقابتی
در مقایسه با دیگر ارائهدهندگان مدلهای زبانی و صوتی، Gemini 2.5 تمرکز زیادی روی ادغام نزدیک با ابزارها و پلتفرمهای گوگل دارد. این یک مزیت برای سازمانهایی است که از اکوسیستم گوگل استفاده میکنند، زیرا اتصال به Vertex AI، Google Cloud و Translate بهراحتی انجام میشود و امکانات توسعه و استقرار سریعتری فراهم میآورد.
مزیت دیگر، بهبود در پیروی از دستورالعملها و مدیریت بافت محاورهای است که در کاربردهای سازمانی و خدمات حساس کیفیت پاسخدهی را ارتقا میدهد.
بهترین روشها برای توسعهدهندگان
طراحی دیالوگ و مدیریت وضعیت
برای استفاده بهینه از Gemini 2.5، توسعهدهندگان باید طراحی دیالوگ را طوری انجام دهند که حافظه محاورهای بهصورت هدفمند ذخیره و بازیابی شود. تعیین نقاط کلیدی برای فراخوانی توابع خارجی و استفاده از قوانین شرطی میتواند از هزینههای غیرضروری جلوگیری کند.
آزمون و اندازهگیری
اندازهگیری KPIهایی مانند نرخ پیروی از دستورالعملها، تاخیر پاسخ، نرخ قطع مکالمه و میزان فراخوانیهای API مفید است. تستهای A/B و شبیهسازیهای کاربری به تشخیص نقاط ضعف و بهینهسازی جریانهای گفتگو کمک میکنند.
محدودیتها و مواردی که باید انتظار داشت
اگرچه Gemini 2.5 پیشرفتهای معناداری دارد، اما هنوز محدودیتهایی وجود دارد: درک کنایهها و اصطلاحات بسیار بومی یا فرهنگی ممکن است همیشه کامل نباشد، و در برخی سناریوها نیاز به تنظیمات توسعهدهنده برای دستیابی به رفتار مطلوب حس میشود. همچنین، توانایی بازیابی طولانیمدت بافتهای بسیار قدیمی یا پیچیده ممکن است محدود باشد.
جمعبندی و چشمانداز آینده
Gemini 2.5 یک گام مهم در جهت طبیعیتر و قابلاطمینانتر شدن تعاملات صوتی با هوش مصنوعی است. این نسخه با بهبود فراخوانی توابع خارجی، افزایش پیروی از دستورالعملهای توسعهدهنده و بازیابی بهتر متنهای پیشین، تجربهای روانتر برای کاربران و ابزارهای قدرتمندتری برای توسعهدهندگان فراهم میآورد. در آینده میتوان انتظار داشت که این قابلیتها گستردهتر شوند، پوشش زبانی Live Translate بهتر شود و توانایی درک لایههای عمیقتر زبانشناسی و فرهنگی تقویت گردد.
اگر در حال طراحی تجربه صوتی یا ادغام قابلیتهای زنده ترجمه هستید، Gemini 2.5 فرصتی مناسب برای کاهش قطعیها، هوشمندسازی فراخوانی داده و پایبندی دقیقتر به قوانین کسبوکاری فراهم میآورد. گام بعدی برای تیمهای فنی آزمایش میدانی در سناریوهای واقعی، تحلیل معیارهای عملکرد و بهکارگیری بهترین شیوهها برای حفظ حریم خصوصی و امنیت است.









نظر بگذارید
نظرات (7)
هنوز باید دید چطور در محاورههای بینزبانی و کنایهها عمل میکنه. ممکنه همیشه نتونه مثل شریک گفتگوی انسانی باشه.
اما امنیت و حریم خصوصی هم باید همزمان پیش بره. لاگبرداری و سیاستهای داده رو روشنتر کنن.
بهکل تغییرات مثبته؛ بازیابی بافت و حفظ انسجام در گفتگوهای چندنوبته تجربه مشتری رو بهتر میکنه.
من با Google AI Studio کار کردم. اگر هماهنگی با APIها واقعاً به کم شدن تاخیر کمک کنه، تجربه پشتیبانی خیلی بهبود پیدا میکنه.
سوالی که دارم اینه: آیا 90٪ پیروی از دستورالعملها پایدار میمونه و در سناریوهای پیچیده واقعاً قابل اعتماد است؟
این نسخه نشون میده روی تجربه کاربر سرمایهگذاری شده؛ اصلاح بافت پاسخها و پیروی از دستورات توسعهدهنده خیلی بهدرد بخوره.
وای این بروزرسانی Gemini 2.5 واقعاً هیجانانگیزه! مخصوصاً اون بهبود فراخوانی توابع خارجی که مکالمه رو روان تر و انسانیتر میکنه.