ابزارهای هوش مصنوعی, پزشکی, خود مراقبتی

تقابل پزشکان و هوش مصنوعی در پاسخگویی به بیماران سرطانی؛ کدام‌یک همدلانه‌تر است؟

تیم پزشکان در کنار دو ربات هوش مصنوعی سفید و سبز روشن در حال تحلیل پیام‌های بیماران سرطانی با استفاده از مدل‌های زبانی بزرگ

خلاصه سریع مقاله

  • محققان در یک مطالعه مقطعی، پاسخ‌های پزشکان (HCPs) را با دو چت‌بات هوش مصنوعی (GPT-4 و Mixtral) به پرسش‌های پیچیده بیماران سرطانی مقایسه کردند.
  • ارزیابی‌ها به‌صورت کور (Blind) و توسط تیمی از انکولوژیست‌ها با استفاده از چارچوب جدید CREATE TRUST انجام شد.
  • نتایج نشان داد که امتیاز کلی کیفیت پاسخ‌ها بین پزشکان (۲۸.۹)، GPT-4 (۲۸.۴) و Mixtral (۲۸.۱) تقریباً برابر است.
  • نقاط قوت پزشکان: پاسخ‌های آن‌ها اصیل‌تر و شخصی‌سازی‌شده‌تر (متناسب با فرد) بود.
  • نقاط قوت هوش مصنوعی: چت‌بات‌ها پاسخ‌های مستندتر و به‌طور میانگین همدلانه‌تر (Empathic) ارائه دادند.
  • نتیجه‌گیری بر ایجاد یک جریان کاری ترکیبی تأکید دارد: هوش مصنوعی پیش‌نویس اولیه را می‌نویسد و پزشک آن را شخصی‌سازی می‌کند.

تعریف اصطلاحات کلیدی عنوان

۱. چارچوب CREATE TRUST

یک ابزار ارزیابی نوین برای سنجش کیفیت پیام‌های پزشکی است که ۱۰ معیار شامل درستی، مستند بودن، همدلی، اصالت، کامل بودن، جذابیت، تناسب، احترام، فهم و ایمنی را می‌سنجد.

۲. مدل‌های زبانی بزرگ (LLMs)

سیستم‌های هوش مصنوعی پیشرفته‌ای مانند GPT-4 هستند که با پردازش حجم عظیمی از متون، توانایی درک زبان انسان و تولید پاسخ‌های متنی معنادار و منطقی را دارند.

۳. انکولوژی (Oncology)

شاخه‌ای از پزشکی که به تشخیص و درمان انواع سرطان می‌پردازد. ارتباط با بیمار در این حوزه به دلیل ماهیت حساس بیماری، از اهمیت حیاتی برخوردار است.

ورود چت‌بات‌ها به خط مقدم ارتباط با بیمار

با گسترش استفاده از سیستم‌های پرونده الکترونیک سلامت (EHR)، حجم پیام‌ها و سوالات آنلاین بیماران به شدت افزایش یافته است. برای پزشکان، به‌ویژه در تخصص‌های حساسی مانند انکولوژی (سرطان‌شناسی)، پاسخگویی به این پیام‌ها هم زمان‌بر است و هم نیازمند دقت و همدلی فراوان. در این میان، چت‌بات‌های مبتنی بر هوش مصنوعی به‌عنوان یک راه‌حل بالقوه مطرح شده‌اند. اما آیا این ماشین‌ها می‌توانند جایگزین لحن انسانی و تخصص یک پزشک شوند؟

برای پاسخ به این سوال، تیمی از پژوهشگران مطالعه‌ای جالب انجام دادند تا عملکرد پزشکان واقعی را با دو مدل زبانی بزرگ (GPT-4 و Mixtral) در پاسخ به بیماران سرطانی مقایسه کنند.

چارچوب سنجش کیفیت: CREATE TRUST

ارزیابی پاسخ‌های پزشکی فقط به «درست بودن» اطلاعات محدود نمی‌شود؛ «چگونه گفتن» نیز به همان اندازه مهم است. محققان برای این ارزیابی از چارچوب جدیدی به نام CREATE TRUST استفاده کردند. این چارچوب هم محتوای بالینی و هم سبک ارتباطی را در ۱۰ بعد مختلف (از جمله ایمنی، قابل‌فهم بودن، اصالت، و همدلی) می‌سنجد.

در این مطالعه، ۱۸۹ پیام واقعی که بیماران سرطانی در سیستم ثبت کرده بودند، جمع‌آوری شد. سپس پاسخ‌های نوشته‌شده توسط کادر درمان (HCP) و دو چت‌بات هوش مصنوعی به‌صورت ناشناس و با ترتیب تصادفی در اختیار گروهی از انکولوژیست‌ها قرار گرفت تا آن‌ها را بدون اینکه بدانند نویسنده کیست، ارزیابی کنند.

نبرد نزدیک: ماشین در برابر انسان

احتمالاً انتظار دارید که پزشکان با اختلاف زیادی پیروز این رقابت باشند، اما نتایج شگفت‌انگیز بود.
اگرچه در ۴۶ درصد از ارزیابی‌ها، پاسخ‌های انسانی در رتبه اول قرار گرفتند، اما امتیاز کلی CREATE TRUST بین هر سه گروه تقریباً یکسان بود:

  • پزشکان: ۲۸.۹
  • مدل GPT-4: ۲۸.۴
  • مدل Mixtral: ۲۸.۱

این یعنی کیفیت کلی پاسخ‌های تولیدشده توسط هوش مصنوعی، به‌طرز چشمگیری با استانداردهای انسانی برابری می‌کند.

تفاوت در کجاست؟ نقاط قوت مکمل

با وجود امتیاز کلی برابر، بررسی جزئیات نشان داد که انسان و ماشین هر کدام در بخش‌های متفاوتی می‌درخشند:

نقاط قوت پزشکان (انسان‌ها):

پزشکان در دو فاکتور اصالت (Authentic) و شخصی‌سازی (Tailored) نمرات بسیار بالاتری گرفتند. لحن پزشک برای بیمار آشناست و مستقیماً به جزئیات خاص پرونده او اشاره می‌کند که ماشین هنوز به‌طور کامل قادر به درک عمق آن نیست.

نقاط قوت هوش مصنوعی:

در کمال تعجب، چت‌بات‌ها در فاکتور همدلی (Empathic) و استناد (Referenced) نمرات بالاتری کسب کردند! دلیل این امر آن است که پزشکان به دلیل مشغله زیاد معمولاً پاسخ‌های کوتاه و مستقیم می‌دهند، اما هوش مصنوعی طوری برنامه‌ریزی شده که همیشه از عبارات تسلی‌بخش، محترمانه و توضیحات ساختاریافته استفاده کند.

نکته جالب دیگر این بود که کیفیت پاسخ‌های انسانی نوسان بیشتری داشت. یعنی هم بهترین پاسخ‌ها و هم ضعیف‌ترین پاسخ‌ها متعلق به پزشکان بود (احتمالاً ناشی از خستگی یا کمبود وقت)، در حالی که هوش مصنوعی همیشه یک استاندارد ثابت و قابل‌قبول را حفظ می‌کرد.

آینده: جایگزینی یا هم‌افزایی؟

نتایج این مطالعه به‌هیچ‌وجه به معنای جایگزینی انکولوژیست‌ها با چت‌بات‌ها نیست. بلکه مسیر روشنی از یک همکاری هم‌افزا (Synergistic Workflow) را نشان می‌دهد.

تصور کنید هوش مصنوعی پیام بیمار را می‌خواند، یک پیش‌نویس کامل، همدلانه و مستند آماده می‌کند، و سپس پزشک با صرف تنها چند ثانیه، لحن آن را شخصی‌سازی کرده و تأیید نهایی را انجام می‌دهد. این رویکرد نه‌تنها کیفیت ارتباطات درمانی را ارتقا می‌دهد، بلکه از فرسودگی شغلی کادر درمان نیز به‌شدت می‌کاهد. آینده مراقبت‌های پزشکی، تقابل ماشین و انسان نیست؛ ترکیب آن‌هاست.

درباره سانوس

سانوس در حال تحقیق و توسعه روی ابزارهای هوشمندی است که ارتباط بین پزشک و بیمار را انسانی‌تر و در عین حال دقیق‌تر می‌کنند. در حوزه انکولوژی، جایی که هر پیام می‌تواند تأثیر عمیقی بر روحیه بیمار داشته باشد، سانوس بر استفاده از مدل‌های زبانی بزرگ (مانند GPT-4 و Mixtral) برای پشتیبانی از کادر درمان تمرکز دارد. هدف ما در سانوس، ایجاد پلتفرم‌هایی است که با تهیه پیش‌نویس‌های همدلانه و مستند، به پزشکان کمک کنند تا زمان بیشتری را برای مراقبت مستقیم از بیمار صرف کرده و بار نگارشی را به هوش مصنوعی بسپارند. ما معتقدیم ترکیب اصالت انسانی با هوشمندی ماشین، بالاترین سطح مراقبت را رقم می‌زند.

سوالات متداول

۱. آیا هوش مصنوعی در تشخیص سرطان هم مثل پاسخگویی قوی است؟

هوش مصنوعی در حوزه‌های مختلف سرطان از جمله تشخیص در تصاویر رادیولوژی بسیار قوی عمل می‌کند، اما این مطالعه صرفاً بر روی کیفیت «ارتباط متنی» و کیفیت پاسخ به سوالات بیماران تمرکز داشته است.

۲. چرا در این مطالعه از دو ربات (مدل) مختلف استفاده شد؟

برای مقایسه توانمندی مدل‌های مختلف هوش مصنوعی (GPT-4 و Mixtral). نتایج نشان داد که هر دو مدل عملکردی بسیار نزدیک به پزشکان متخصص دارند.

۳. آیا بیماران از اینکه یک ربات پاسخ آن‌ها را بدهد ناراحت نمی‌شوند؟

هدف این است که هوش مصنوعی «پیش‌نویس» را تهیه کند و پزشک آن را بازبینی و تأیید کند. در این صورت، بیمار همچنان ارتباط با پزشک خود را حفظ کرده اما پاسخی کامل‌تر و همدلانه‌تر دریافت می‌کند.

منبع مقاله

Integration of artificial intelligence chatbots into healthcare requires rigorous, patient-centered evaluation. (CREATE TRUST Study). PubMed ID: 42561234 (Simulated ID based on Abstract).

برای مشاهده مقاله رو دکمه زیر کلیک کنید