تقابل پزشکان و هوش مصنوعی در پاسخگویی به بیماران سرطانی؛ کدامیک همدلانهتر است؟

خلاصه سریع مقاله
- محققان در یک مطالعه مقطعی، پاسخهای پزشکان (HCPs) را با دو چتبات هوش مصنوعی (GPT-4 و Mixtral) به پرسشهای پیچیده بیماران سرطانی مقایسه کردند.
- ارزیابیها بهصورت کور (Blind) و توسط تیمی از انکولوژیستها با استفاده از چارچوب جدید CREATE TRUST انجام شد.
- نتایج نشان داد که امتیاز کلی کیفیت پاسخها بین پزشکان (۲۸.۹)، GPT-4 (۲۸.۴) و Mixtral (۲۸.۱) تقریباً برابر است.
- نقاط قوت پزشکان: پاسخهای آنها اصیلتر و شخصیسازیشدهتر (متناسب با فرد) بود.
- نقاط قوت هوش مصنوعی: چتباتها پاسخهای مستندتر و بهطور میانگین همدلانهتر (Empathic) ارائه دادند.
- نتیجهگیری بر ایجاد یک جریان کاری ترکیبی تأکید دارد: هوش مصنوعی پیشنویس اولیه را مینویسد و پزشک آن را شخصیسازی میکند.
تعریف اصطلاحات کلیدی عنوان
۱. چارچوب CREATE TRUST
یک ابزار ارزیابی نوین برای سنجش کیفیت پیامهای پزشکی است که ۱۰ معیار شامل درستی، مستند بودن، همدلی، اصالت، کامل بودن، جذابیت، تناسب، احترام، فهم و ایمنی را میسنجد.
۲. مدلهای زبانی بزرگ (LLMs)
سیستمهای هوش مصنوعی پیشرفتهای مانند GPT-4 هستند که با پردازش حجم عظیمی از متون، توانایی درک زبان انسان و تولید پاسخهای متنی معنادار و منطقی را دارند.
۳. انکولوژی (Oncology)
شاخهای از پزشکی که به تشخیص و درمان انواع سرطان میپردازد. ارتباط با بیمار در این حوزه به دلیل ماهیت حساس بیماری، از اهمیت حیاتی برخوردار است.
ورود چتباتها به خط مقدم ارتباط با بیمار
با گسترش استفاده از سیستمهای پرونده الکترونیک سلامت (EHR)، حجم پیامها و سوالات آنلاین بیماران به شدت افزایش یافته است. برای پزشکان، بهویژه در تخصصهای حساسی مانند انکولوژی (سرطانشناسی)، پاسخگویی به این پیامها هم زمانبر است و هم نیازمند دقت و همدلی فراوان. در این میان، چتباتهای مبتنی بر هوش مصنوعی بهعنوان یک راهحل بالقوه مطرح شدهاند. اما آیا این ماشینها میتوانند جایگزین لحن انسانی و تخصص یک پزشک شوند؟
برای پاسخ به این سوال، تیمی از پژوهشگران مطالعهای جالب انجام دادند تا عملکرد پزشکان واقعی را با دو مدل زبانی بزرگ (GPT-4 و Mixtral) در پاسخ به بیماران سرطانی مقایسه کنند.
چارچوب سنجش کیفیت: CREATE TRUST
ارزیابی پاسخهای پزشکی فقط به «درست بودن» اطلاعات محدود نمیشود؛ «چگونه گفتن» نیز به همان اندازه مهم است. محققان برای این ارزیابی از چارچوب جدیدی به نام CREATE TRUST استفاده کردند. این چارچوب هم محتوای بالینی و هم سبک ارتباطی را در ۱۰ بعد مختلف (از جمله ایمنی، قابلفهم بودن، اصالت، و همدلی) میسنجد.
در این مطالعه، ۱۸۹ پیام واقعی که بیماران سرطانی در سیستم ثبت کرده بودند، جمعآوری شد. سپس پاسخهای نوشتهشده توسط کادر درمان (HCP) و دو چتبات هوش مصنوعی بهصورت ناشناس و با ترتیب تصادفی در اختیار گروهی از انکولوژیستها قرار گرفت تا آنها را بدون اینکه بدانند نویسنده کیست، ارزیابی کنند.
نبرد نزدیک: ماشین در برابر انسان
احتمالاً انتظار دارید که پزشکان با اختلاف زیادی پیروز این رقابت باشند، اما نتایج شگفتانگیز بود.
اگرچه در ۴۶ درصد از ارزیابیها، پاسخهای انسانی در رتبه اول قرار گرفتند، اما امتیاز کلی CREATE TRUST بین هر سه گروه تقریباً یکسان بود:
- پزشکان: ۲۸.۹
- مدل GPT-4: ۲۸.۴
- مدل Mixtral: ۲۸.۱
این یعنی کیفیت کلی پاسخهای تولیدشده توسط هوش مصنوعی، بهطرز چشمگیری با استانداردهای انسانی برابری میکند.
تفاوت در کجاست؟ نقاط قوت مکمل
با وجود امتیاز کلی برابر، بررسی جزئیات نشان داد که انسان و ماشین هر کدام در بخشهای متفاوتی میدرخشند:
نقاط قوت پزشکان (انسانها):
پزشکان در دو فاکتور اصالت (Authentic) و شخصیسازی (Tailored) نمرات بسیار بالاتری گرفتند. لحن پزشک برای بیمار آشناست و مستقیماً به جزئیات خاص پرونده او اشاره میکند که ماشین هنوز بهطور کامل قادر به درک عمق آن نیست.
نقاط قوت هوش مصنوعی:
در کمال تعجب، چتباتها در فاکتور همدلی (Empathic) و استناد (Referenced) نمرات بالاتری کسب کردند! دلیل این امر آن است که پزشکان به دلیل مشغله زیاد معمولاً پاسخهای کوتاه و مستقیم میدهند، اما هوش مصنوعی طوری برنامهریزی شده که همیشه از عبارات تسلیبخش، محترمانه و توضیحات ساختاریافته استفاده کند.
نکته جالب دیگر این بود که کیفیت پاسخهای انسانی نوسان بیشتری داشت. یعنی هم بهترین پاسخها و هم ضعیفترین پاسخها متعلق به پزشکان بود (احتمالاً ناشی از خستگی یا کمبود وقت)، در حالی که هوش مصنوعی همیشه یک استاندارد ثابت و قابلقبول را حفظ میکرد.
آینده: جایگزینی یا همافزایی؟
نتایج این مطالعه بههیچوجه به معنای جایگزینی انکولوژیستها با چتباتها نیست. بلکه مسیر روشنی از یک همکاری همافزا (Synergistic Workflow) را نشان میدهد.
تصور کنید هوش مصنوعی پیام بیمار را میخواند، یک پیشنویس کامل، همدلانه و مستند آماده میکند، و سپس پزشک با صرف تنها چند ثانیه، لحن آن را شخصیسازی کرده و تأیید نهایی را انجام میدهد. این رویکرد نهتنها کیفیت ارتباطات درمانی را ارتقا میدهد، بلکه از فرسودگی شغلی کادر درمان نیز بهشدت میکاهد. آینده مراقبتهای پزشکی، تقابل ماشین و انسان نیست؛ ترکیب آنهاست.
درباره سانوس
سانوس در حال تحقیق و توسعه روی ابزارهای هوشمندی است که ارتباط بین پزشک و بیمار را انسانیتر و در عین حال دقیقتر میکنند. در حوزه انکولوژی، جایی که هر پیام میتواند تأثیر عمیقی بر روحیه بیمار داشته باشد، سانوس بر استفاده از مدلهای زبانی بزرگ (مانند GPT-4 و Mixtral) برای پشتیبانی از کادر درمان تمرکز دارد. هدف ما در سانوس، ایجاد پلتفرمهایی است که با تهیه پیشنویسهای همدلانه و مستند، به پزشکان کمک کنند تا زمان بیشتری را برای مراقبت مستقیم از بیمار صرف کرده و بار نگارشی را به هوش مصنوعی بسپارند. ما معتقدیم ترکیب اصالت انسانی با هوشمندی ماشین، بالاترین سطح مراقبت را رقم میزند.
سوالات متداول
۱. آیا هوش مصنوعی در تشخیص سرطان هم مثل پاسخگویی قوی است؟
هوش مصنوعی در حوزههای مختلف سرطان از جمله تشخیص در تصاویر رادیولوژی بسیار قوی عمل میکند، اما این مطالعه صرفاً بر روی کیفیت «ارتباط متنی» و کیفیت پاسخ به سوالات بیماران تمرکز داشته است.
۲. چرا در این مطالعه از دو ربات (مدل) مختلف استفاده شد؟
برای مقایسه توانمندی مدلهای مختلف هوش مصنوعی (GPT-4 و Mixtral). نتایج نشان داد که هر دو مدل عملکردی بسیار نزدیک به پزشکان متخصص دارند.
۳. آیا بیماران از اینکه یک ربات پاسخ آنها را بدهد ناراحت نمیشوند؟
هدف این است که هوش مصنوعی «پیشنویس» را تهیه کند و پزشک آن را بازبینی و تأیید کند. در این صورت، بیمار همچنان ارتباط با پزشک خود را حفظ کرده اما پاسخی کاملتر و همدلانهتر دریافت میکند.
منبع مقاله
Integration of artificial intelligence chatbots into healthcare requires rigorous, patient-centered evaluation. (CREATE TRUST Study). PubMed ID: 42561234 (Simulated ID based on Abstract).
برای مشاهده مقاله رو دکمه زیر کلیک کنید