5 دقیقه
از یک چتبات هوش مصنوعی درباره قیمت سهام، تاریخ جلسه دادگاه یا نام یکی از مدیران شرکت بپرسید و ممکن است پاسخ با اطمینان کامل ارائه شود. همین بخش نگرانکننده ماجراست. جمله ممکن است روان و حرفهای به نظر برسد، لحن آن قاطع باشد، اما واقعیتها همچنان نادرست باشند.
یک تحلیل جدید درباره میزان قابلیت اعتماد از سوی Legal Guardian Digital، شرکت سئو متمرکز بر وکلا و موسسات حقوقی، عدد و رقم دقیقی برای مشکلی ارائه میدهد که بسیاری از کاربران از قبل آن را میشناسند: برخی از چتباتهای محبوب هوش مصنوعی بسیار بیشتر از بقیه دچار هذیانگویی یا هالوسینیشن میشوند. با توجه به اینکه اکنون حدود یکچهارم کارگران آمریکایی بهطور منظم از ابزارهای هوش مصنوعی استفاده میکنند، تفاوت میان یک دستیار مفید و یک منبع قانعکننده برای اطلاعات نادرست، موضوع کوچکی نیست.
بخش نگرانکننده: اطمینان، برابر با دقت نیست
مدلهای زبانی بزرگ مثل انسان فکر نمیکنند. آنها طوری آموزش میبینند که بر اساس الگوهای موجود در حجم عظیمی از متن، محتملترین واژهها و عبارتها را پیشبینی کنند. وقتی سیستم زمینه کافی داشته باشد، این فرایند میتواند پاسخهایی سریع و کاربردی تولید کند. اما وقتی چنین زمینهای وجود نداشته باشد، مدل ممکن است همچنان پاسخی تولید کند که منطقی به نظر میرسد، چون از نظر آماری واژهها کنار هم درست نشستهاند.
منظور مردم از اینکه میگویند یک چتبات هوش مصنوعی دچار هذیانگویی شده، معمولاً همین است. این حالت رویاپردازی نیست. در معنای انسانی هم دروغ گفتن نیست. بلکه پاسخی تولید میشود که پشتوانه واقعی و قابلاعتماد ندارد؛ به همین دلیل است که نامها، تاریخها، ارجاعات حقوقی، جزئیات پزشکی، ارقام مالی و اخبار فوری همچنان به بررسی انسانی نیاز دارند.
این مطالعه چند مدل شناختهشده هوش مصنوعی را بر اساس نرخ هذیانگویی، رضایت مشتری، کیفیت پاسخ و زمان فعال بودن سرویس مقایسه کرد. این عوامل در یک امتیاز شاخص از 0 تا 100 ترکیب شدند تا تصویری گستردهتر از اینکه کدام چتباتها در استفاده روزمره قابلاعتمادترند، ارائه شود.
Google Gemini بالاترین نرخ هذیانگویی را در این گروه داشت و طبق گزارشها، در 32 درصد پاسخها اطلاعات نادرست تولید کرده است. این رقم بهویژه با توجه به گزارشهایی جالب است که میگویند اپل دستکم سالانه 1 میلیارد دلار به گوگل پرداخت میکند تا از یک مدل سفارشی Gemini با 1.2 تریلیون پارامتر برای ارتقای آینده Siri استفاده کند؛ ارتقایی که انتظار میرود همراه با iOS 27 ارائه شود.
ChatGPT نیز با فاصله کمی در پی آن قرار گرفت و هذیانگویی در حدود سه پاسخ از هر 10 پاسخ دیده شد. به زبان ساده، اگر این ارقام درست باشند، ChatGPT در این آزمون تقریباً دو برابر DeepSeek احتمال دارد پاسخ نادرست بدهد. این مقایسه احتمالاً توجه زیادی جلب خواهد کرد، نهفقط به این دلیل که DeepSeek با کسری از هزینه آموزشی مدلهای برتر آمریکایی توسعه یافته است.
Perplexity AI از نظر نرخ هذیانگویی بهترین عملکرد را داشت و پاسخهای نادرست در 13 درصد موارد به کاربران رسید. DeepSeek با 14 درصد در رتبه بعدی قرار گرفت و Grok متعلق به ایلان ماسک با 15 درصد در جایگاه سوم بود. برای کاربرانی که برای تحقیق، خلاصهسازی یا بررسی سریع واقعیتها به هوش مصنوعی تکیه میکنند، این اختلافها اهمیت دارد.

آنلاین بودن همچنان مهم است
دقت تنها بخشی از ماجراست. یک چتبات ممکن است روی کاغذ فوقالعاده باشد، اما اگر هنگام نیاز در دسترس نباشد، عملاً بیفایده است. در شاخص زمان فعال بودن سرویس، Perplexity AI و Grok تنها دو سرویسی بودند که در تمام مدت آزمون در دسترس باقی ماندند.
ChatGPT و Gemini خیلی عقب نبودند و نرخ دسترسپذیری آنها بهترتیب 99.98 درصد و 99.95 درصد بود. حتی Claude که پایینترین زمان فعال بودن را در این مطالعه داشت، همچنان با 99.68 درصد بسیار قابلاعتماد باقی ماند. از نظر عملی، بیشتر این ابزارها تقریباً همیشه آنلاین بودند، اما همین تفاوتهای کوچک هم برای کسبوکارهایی که به گردشکارهای مبتنی بر هوش مصنوعی وابستهاند، میتواند مهم باشد.
رضایت کاربران داستان دیگری را نشان داد. DeepSeek و ChatGPT هر دو بالاترین امتیاز رضایت مشتری را با 4.7 از 5 دریافت کردند. Perplexity AI با 4.6 در رتبه بعدی قرار گرفت. Meta AI با 3.4 در انتهای جدول ایستاد و چند مدل دیگر نیز حدود 4.4 امتیاز داشتند.
در بخش ثبات و کیفیت پاسخها، Kimi AI با امتیاز 4.3 از 5 پیشتاز بود. ChatGPT، Microsoft Copilot و Gemini همگی با امتیاز 4.0 برابر شدند. Meta AI دوباره با 3.4 در رتبه آخر قرار گرفت که نشان میدهد امتیاز کلی ضعیف آن فقط ناشی از عملکرد بد در یک دسته خاص نبوده است.
وقتی همه عوامل با هم ترکیب شدند، Perplexity AI با امتیاز شاخص 85 در رتبه اول قرار گرفت. Grok با 79 دوم شد و DeepSeek در جایگاه بعدی ایستاد. ChatGPT با امتیاز 50 رتبه ششم را کسب کرد، در حالی که Gemini با 41 در جایگاه هشتم قرار گرفت. Meta AI نیز با 37 در انتهای فهرست بود.
درس مهمتر این نیست که باید به یک چتبات کورکورانه اعتماد کرد و دیگری را برای همیشه کنار گذاشت. ابزارهای هوش مصنوعی بهسرعت تغییر میکنند. مدلها بهروزرسانی میشوند، محدودیتها جابهجا میشوند و عملکرد میتواند تقریباً یکشبه بهتر شود. با این حال، چنین رتبهبندیای یادآوری مفیدی است: مشهورترین چتبات همیشه قابلاعتمادترین نیست و روانترین پاسخ هم همیشه پاسخ درست نیست.
برای هر کسی که در محل کار از هوش مصنوعی استفاده میکند، رویکرد ایمن ساده است. چتباتها را شتابدهنده بدانید، نه مرجع نهایی. از آنها برای پیشنویسنویسی، سازماندهی، خلاصهسازی و ایدهپردازی استفاده کنید. اما وقتی پاسخ به پول، سلامت، قانون، هویت یا تصمیمی با پیامدهای واقعی مربوط میشود، قبل از اقدام، واقعیتها را بررسی کنید.






نظر بگذارید
نظرات (4)
پس خلاصهاش اینه: برای پیشنویس خوبه، برای تصمیم نهایی نه. همین جمله باید بالای هر چتبات نصب بشه!
من تو کار روزمره هم دیدم، بعضی وقتا چتبات چنان محکم حرف میزنه که آدم شک میکنه خودش اشتباهه 😐
جالبه که فقط اسم مدل مهم نیست، پایداری و دقت هر دو باید باهم دیده بشن. وگرنه یه جواب شیک، هیچ ارزشی نداره
واقعاً ترسناکتر از خودِ هوش مصنوعیه که با اعتماد به نفس جواب غلط میده... مخصوصاً برای کار حقوقی یا مالی