چت بات های هوش مصنوعی چقدر قابل اعتمادند؟

یک تحلیل جدید نشان می‌دهد برخی چت‌بات‌های هوش مصنوعی بیشتر از بقیه دچار هذیان‌گویی می‌شوند. در این گزارش، دقت، رضایت کاربران و میزان دسترس‌پذیری مدل‌های محبوب بررسی شده است.

.4 دیدگاه
چت بات های هوش مصنوعی چقدر قابل اعتمادند؟

5 دقیقه

دنبال کردن در گوگل

از یک چت‌بات هوش مصنوعی درباره قیمت سهام، تاریخ جلسه دادگاه یا نام یکی از مدیران شرکت بپرسید و ممکن است پاسخ با اطمینان کامل ارائه شود. همین بخش نگران‌کننده ماجراست. جمله ممکن است روان و حرفه‌ای به نظر برسد، لحن آن قاطع باشد، اما واقعیت‌ها همچنان نادرست باشند.

یک تحلیل جدید درباره میزان قابلیت اعتماد از سوی Legal Guardian Digital، شرکت سئو متمرکز بر وکلا و موسسات حقوقی، عدد و رقم دقیقی برای مشکلی ارائه می‌دهد که بسیاری از کاربران از قبل آن را می‌شناسند: برخی از چت‌بات‌های محبوب هوش مصنوعی بسیار بیشتر از بقیه دچار هذیان‌گویی یا هالوسینیشن می‌شوند. با توجه به اینکه اکنون حدود یک‌چهارم کارگران آمریکایی به‌طور منظم از ابزارهای هوش مصنوعی استفاده می‌کنند، تفاوت میان یک دستیار مفید و یک منبع قانع‌کننده برای اطلاعات نادرست، موضوع کوچکی نیست.

بخش نگران‌کننده: اطمینان، برابر با دقت نیست

مدل‌های زبانی بزرگ مثل انسان فکر نمی‌کنند. آن‌ها طوری آموزش می‌بینند که بر اساس الگوهای موجود در حجم عظیمی از متن، محتمل‌ترین واژه‌ها و عبارت‌ها را پیش‌بینی کنند. وقتی سیستم زمینه کافی داشته باشد، این فرایند می‌تواند پاسخ‌هایی سریع و کاربردی تولید کند. اما وقتی چنین زمینه‌ای وجود نداشته باشد، مدل ممکن است همچنان پاسخی تولید کند که منطقی به نظر می‌رسد، چون از نظر آماری واژه‌ها کنار هم درست نشسته‌اند.

منظور مردم از این‌که می‌گویند یک چت‌بات هوش مصنوعی دچار هذیان‌گویی شده، معمولاً همین است. این حالت رویاپردازی نیست. در معنای انسانی هم دروغ گفتن نیست. بلکه پاسخی تولید می‌شود که پشتوانه واقعی و قابل‌اعتماد ندارد؛ به همین دلیل است که نام‌ها، تاریخ‌ها، ارجاعات حقوقی، جزئیات پزشکی، ارقام مالی و اخبار فوری همچنان به بررسی انسانی نیاز دارند.

این مطالعه چند مدل شناخته‌شده هوش مصنوعی را بر اساس نرخ هذیان‌گویی، رضایت مشتری، کیفیت پاسخ و زمان فعال بودن سرویس مقایسه کرد. این عوامل در یک امتیاز شاخص از 0 تا 100 ترکیب شدند تا تصویری گسترده‌تر از این‌که کدام چت‌بات‌ها در استفاده روزمره قابل‌اعتمادترند، ارائه شود.

Google Gemini بالاترین نرخ هذیان‌گویی را در این گروه داشت و طبق گزارش‌ها، در 32 درصد پاسخ‌ها اطلاعات نادرست تولید کرده است. این رقم به‌ویژه با توجه به گزارش‌هایی جالب است که می‌گویند اپل دست‌کم سالانه 1 میلیارد دلار به گوگل پرداخت می‌کند تا از یک مدل سفارشی Gemini با 1.2 تریلیون پارامتر برای ارتقای آینده Siri استفاده کند؛ ارتقایی که انتظار می‌رود همراه با iOS 27 ارائه شود.

ChatGPT نیز با فاصله کمی در پی آن قرار گرفت و هذیان‌گویی در حدود سه پاسخ از هر 10 پاسخ دیده شد. به زبان ساده، اگر این ارقام درست باشند، ChatGPT در این آزمون تقریباً دو برابر DeepSeek احتمال دارد پاسخ نادرست بدهد. این مقایسه احتمالاً توجه زیادی جلب خواهد کرد، نه‌فقط به این دلیل که DeepSeek با کسری از هزینه آموزشی مدل‌های برتر آمریکایی توسعه یافته است.

Perplexity AI از نظر نرخ هذیان‌گویی بهترین عملکرد را داشت و پاسخ‌های نادرست در 13 درصد موارد به کاربران رسید. DeepSeek با 14 درصد در رتبه بعدی قرار گرفت و Grok متعلق به ایلان ماسک با 15 درصد در جایگاه سوم بود. برای کاربرانی که برای تحقیق، خلاصه‌سازی یا بررسی سریع واقعیت‌ها به هوش مصنوعی تکیه می‌کنند، این اختلاف‌ها اهمیت دارد.

آنلاین بودن همچنان مهم است

دقت تنها بخشی از ماجراست. یک چت‌بات ممکن است روی کاغذ فوق‌العاده باشد، اما اگر هنگام نیاز در دسترس نباشد، عملاً بی‌فایده است. در شاخص زمان فعال بودن سرویس، Perplexity AI و Grok تنها دو سرویسی بودند که در تمام مدت آزمون در دسترس باقی ماندند.

ChatGPT و Gemini خیلی عقب نبودند و نرخ دسترس‌پذیری آن‌ها به‌ترتیب 99.98 درصد و 99.95 درصد بود. حتی Claude که پایین‌ترین زمان فعال بودن را در این مطالعه داشت، همچنان با 99.68 درصد بسیار قابل‌اعتماد باقی ماند. از نظر عملی، بیشتر این ابزارها تقریباً همیشه آنلاین بودند، اما همین تفاوت‌های کوچک هم برای کسب‌وکارهایی که به گردش‌کارهای مبتنی بر هوش مصنوعی وابسته‌اند، می‌تواند مهم باشد.

رضایت کاربران داستان دیگری را نشان داد. DeepSeek و ChatGPT هر دو بالاترین امتیاز رضایت مشتری را با 4.7 از 5 دریافت کردند. Perplexity AI با 4.6 در رتبه بعدی قرار گرفت. Meta AI با 3.4 در انتهای جدول ایستاد و چند مدل دیگر نیز حدود 4.4 امتیاز داشتند.

در بخش ثبات و کیفیت پاسخ‌ها، Kimi AI با امتیاز 4.3 از 5 پیشتاز بود. ChatGPT، Microsoft Copilot و Gemini همگی با امتیاز 4.0 برابر شدند. Meta AI دوباره با 3.4 در رتبه آخر قرار گرفت که نشان می‌دهد امتیاز کلی ضعیف آن فقط ناشی از عملکرد بد در یک دسته خاص نبوده است.

وقتی همه عوامل با هم ترکیب شدند، Perplexity AI با امتیاز شاخص 85 در رتبه اول قرار گرفت. Grok با 79 دوم شد و DeepSeek در جایگاه بعدی ایستاد. ChatGPT با امتیاز 50 رتبه ششم را کسب کرد، در حالی که Gemini با 41 در جایگاه هشتم قرار گرفت. Meta AI نیز با 37 در انتهای فهرست بود.

درس مهم‌تر این نیست که باید به یک چت‌بات کورکورانه اعتماد کرد و دیگری را برای همیشه کنار گذاشت. ابزارهای هوش مصنوعی به‌سرعت تغییر می‌کنند. مدل‌ها به‌روزرسانی می‌شوند، محدودیت‌ها جابه‌جا می‌شوند و عملکرد می‌تواند تقریباً یک‌شبه بهتر شود. با این حال، چنین رتبه‌بندی‌ای یادآوری مفیدی است: مشهورترین چت‌بات همیشه قابل‌اعتمادترین نیست و روان‌ترین پاسخ هم همیشه پاسخ درست نیست.

برای هر کسی که در محل کار از هوش مصنوعی استفاده می‌کند، رویکرد ایمن ساده است. چت‌بات‌ها را شتاب‌دهنده بدانید، نه مرجع نهایی. از آن‌ها برای پیش‌نویس‌نویسی، سازمان‌دهی، خلاصه‌سازی و ایده‌پردازی استفاده کنید. اما وقتی پاسخ به پول، سلامت، قانون، هویت یا تصمیمی با پیامدهای واقعی مربوط می‌شود، قبل از اقدام، واقعیت‌ها را بررسی کنید.

مهدی بهرامی
"محتوای آموزشی درباره هوش مصنوعی و یادگیری ماشینی تولید می‌کنم، به‌صورتی که برای خواننده عمومی قابل‌فهم باشد و کاربردهای واقعی را نشان دهد."

نظر بگذارید

نظرات (4)

بلاک‌تون

پس خلاصه‌اش اینه: برای پیش‌نویس خوبه، برای تصمیم نهایی نه. همین جمله باید بالای هر چت‌بات نصب بشه!

نوا_ای

من تو کار روزمره هم دیدم، بعضی وقتا چت‌بات چنان محکم حرف میزنه که آدم شک میکنه خودش اشتباهه 😐

آرmin

جالبه که فقط اسم مدل مهم نیست، پایداری و دقت هر دو باید باهم دیده بشن. وگرنه یه جواب شیک، هیچ ارزشی نداره

دیتاپالس

واقعاً ترسناک‌تر از خودِ هوش مصنوعیه که با اعتماد به نفس جواب غلط میده... مخصوصاً برای کار حقوقی یا مالی