پزشکی

هوش مصنوعی در ماموگرافی چگونه دقت تشخیص سرطان پستان را افزایش می‌دهد؟ نتایج مطالعه سه‌ساله در روسیه

هوش مصنوعی در ماموگرافی

هوش مصنوعی در ماموگرافی چگونه دقت تشخیص سرطان پستان را افزایش می‌دهد؟

ادغام هوش مصنوعی در تصویربرداری پزشکی، به‌ویژه ماموگرافی، یکی از مهم‌ترین مسیرهای تحول در غربالگری و تشخیص زودهنگام سرطان پستان است. مقاله‌ای با عنوان «پیاده‌سازی سامانه مبتنی بر هوش مصنوعی برای ماموگرافی در برنامه بیمه درمانی اجباری: نتایج یک مطالعه سه‌ساله» تجربه استقرار یک سامانه هوش مصنوعی ماموگرافی را در محیط واقعی نظام سلامت روسیه بررسی کرده است.

اهمیت این پژوهش در آن است که صرفاً عملکرد الگوریتم را روی یک مجموعه‌داده ثابت ارزیابی نمی‌کند؛ بلکه چرخه کامل استفاده از هوش مصنوعی در پزشکی، شامل آزمون اولیه، پایش مداوم در محیط بالینی، دریافت بازخورد رادیولوژیست‌ها و به‌روزرسانی‌های متوالی نرم‌افزار را مورد توجه قرار می‌دهد. نتایج نشان داد که طی دوره مطالعه، مساحت زیر منحنی، دقت، حساسیت و ویژگی سامانه افزایش یافت و میزان خطاهای فنی نیز کاهش پیدا کرد.

خلاصه سریع

  • این مطالعه پیاده‌سازی یک سامانه هوش مصنوعی برای تحلیل ماموگرافی را در برنامه بیمه درمانی اجباری روسیه ارزیابی کرد.
  • داده‌های ۴۰۴٬۵۰۲ ماموگرافی از ۲۰۶ سازمان پزشکی و سه تولیدکننده تجهیزات ماموگرافی بررسی شد.
  • در این پروژه ۳۳۶ رادیولوژیست مشارکت داشتند و دوره آزمون و پایش ۲ سال و ۵ ماه طول کشید.
  • مساحت زیر منحنی یا AUC از ۰٫۸۳ به ۰٫۹۲ افزایش یافت.
  • دقت سامانه از ۰٫۷۷ به ۰٫۹۰ رسید و حساسیت از ۰٫۸۴ به ۰٫۸۸ افزایش پیدا کرد.
  • ویژگی سامانه از ۰٫۷۰ به ۰٫۹۱ ارتقا یافت؛ این تغییر به معنای کاهش قابل توجه نتایج مثبت کاذب است.
  • میانگین میزان نقص فنی از ۳ درصد به ۰٫۸ درصد کاهش یافت.
  • امتیاز ارزیابی بالینی از ۵۴٫۳۸ درصد به ۸۰٫۳۶ درصد رسید.
  • در نهایت، سامانه در برنامه منطقه‌ای بیمه درمانی اجباری ادغام شد.
  • محدودیت‌های مهم پژوهش شامل کوچک بودن مجموعه‌داده کالیبراسیون گذشته‌نگر و نبود اعتبارسنجی خارجی در مناطق یا کشورهای دیگر بود.

تعاریف ضروری

ماموگرافی چیست؟

ماموگرافی نوعی تصویربرداری با اشعه ایکس از پستان است که برای غربالگری سرطان پستان و بررسی توده‌ها، کلسیفیکاسیون‌ها، عدم تقارن‌ها و سایر تغییرات بافتی استفاده می‌شود. این روش می‌تواند برخی سرطان‌ها را پیش از ایجاد علائم بالینی شناسایی کند، اما تفسیر آن به تخصص رادیولوژیست، کیفیت تصویر، تراکم بافت پستان و حجم کاری مرکز تصویربرداری وابسته است.

هوش مصنوعی در ماموگرافی

هوش مصنوعی در ماموگرافی به الگوریتم‌هایی گفته می‌شود که با تحلیل تصاویر دیجیتال پستان، نواحی مشکوک را شناسایی، علامت‌گذاری یا برای بررسی بیشتر اولویت‌بندی می‌کنند. این سامانه‌ها معمولاً برای جایگزینی پزشک طراحی نمی‌شوند؛ بلکه به‌عنوان ابزار پشتیبان تصمیم‌گیری، کنترل کیفیت و تریاژ تصاویر به کار می‌روند.

مساحت زیر منحنی یا AUC

AUC شاخصی برای سنجش توانایی یک مدل در تفکیک موارد دارای بیماری از موارد بدون بیماری است. مقدار AUC بین صفر و یک قرار دارد و هرچه به یک نزدیک‌تر باشد، توان تمایز مدل بیشتر است. افزایش AUC از ۰٫۸۳ به ۰٫۹۲ در این مطالعه نشان‌دهنده بهبود توانایی سامانه برای تشخیص الگوهای مرتبط با سرطان پستان بود.

حساسیت و ویژگی

حساسیت نشان می‌دهد سامانه چه نسبتی از موارد واقعاً بیمار را به‌درستی شناسایی می‌کند. حساسیت پایین می‌تواند با افزایش موارد منفی کاذب همراه باشد؛ یعنی بیماری وجود داشته باشد اما سامانه آن را شناسایی نکند. ویژگی بیانگر توانایی سامانه در شناسایی درست افراد فاقد بیماری است. افزایش ویژگی معمولاً به کاهش مثبت کاذب و ارجاع‌های غیرضروری کمک می‌کند.

آزمون چرخه عمر سامانه هوش مصنوعی

آزمون چرخه عمر به ارزیابی مستمر سامانه از زمان توسعه و استقرار تا زمان به‌روزرسانی و استفاده گسترده در محیط واقعی اشاره دارد. این رویکرد اهمیت زیادی دارد، زیرا عملکرد یک الگوریتم ممکن است پس از تغییر تجهیزات، جمعیت، پروتکل‌های تصویربرداری یا الگوهای کاری رادیولوژیست‌ها تغییر کند.

چرا اعتبارسنجی هوش مصنوعی در ماموگرافی اهمیت دارد؟

بسیاری از الگوریتم‌های تصویربرداری پزشکی ابتدا روی مجموعه‌داده‌هایی محدود و نسبتاً کنترل‌شده ارزیابی می‌شوند. این داده‌ها ممکن است از یک مرکز، یک نوع دستگاه یا جمعیتی خاص به دست آمده باشند. در محیط واقعی، شرایط متفاوت است: کیفیت تصاویر یکنواخت نیست، دستگاه‌ها از تولیدکنندگان مختلف هستند، تراکم پستان در افراد متفاوت است و رادیولوژیست‌ها نیز تجربه و سبک گزارش‌نویسی یکسانی ندارند.

علاوه بر این، سامانه‌های هوش مصنوعی پس از استقرار ممکن است با بازآموزی یا به‌روزرسانی نرم‌افزاری تغییر کنند. بنابراین، نتیجه یک ارزیابی اولیه نمی‌تواند عملکرد نسخه‌های بعدی را به‌طور کامل پیش‌بینی کند. پژوهش حاضر تلاش کرده است به‌جای یک ارزیابی مقطعی، سازوکاری برای آزمون و پایش مداوم ایجاد کند.

روش تحقیق مطالعه

طراحی پژوهش

این پژوهش یک مطالعه مشاهده‌ای بود که از ترکیب چند مرحله تشکیل شد: آزمون عملکردی گذشته‌نگر، آزمون کالیبراسیون گذشته‌نگر، پایش فنی آینده‌نگر و پایش بالینی آینده‌نگر. این مراحل در میان به‌روزرسانی‌های سامانه انجام شدند تا تغییرات عملکرد الگوریتم در طول زمان ثبت و ارزیابی شود.

جامعه و داده‌های مورد بررسی

داده‌های مطالعه شامل ماموگرافی‌های دیجیتال زنان ۱۸ ساله و بالاتر بود. در بخش پایش آینده‌نگر، تمام ماموگرافی‌های انجام‌شده در مراکز مشارکت‌کننده وارد فرآیند بررسی شدند و بر اساس متن مقاله، برای این بخش معیار حذفی اعمال نشد. مجموعه نهایی آزمون شامل ۴۰۴٬۵۰۲ ماموگرافی از ۲۰۶ سازمان پزشکی بود. تصاویر با استفاده از تجهیزات متعلق به سه تولیدکننده مختلف ثبت شده بودند؛ موضوعی که به ارزیابی عملکرد سامانه در شرایط متنوع‌تر کمک می‌کند.

معماری فنی سامانه

سامانه هوش مصنوعی از معماری‌های U-Net++ و Mask2Former استفاده می‌کرد. U-Net++ از خانواده مدل‌های قطعه‌بندی تصویر است و برای شناسایی دقیق نواحی مورد نظر در تصویر کاربرد دارد. Mask2Former نیز معماری پیشرفته‌ای برای قطعه‌بندی معنایی و شناسایی نواحی مختلف تصویر محسوب می‌شود. ترکیب این رویکردها می‌تواند به سامانه کمک کند مناطق مشکوک را بهتر مکان‌یابی و از بافت‌های طبیعی تفکیک کند.

سامانه بر اساس حدود ۴۰۰۰ ماموگرافی آموزش داده شده بود. با این حال، اندازه مجموعه آموزش به‌تنهایی تعیین‌کننده کیفیت نهایی نیست و عواملی مانند تنوع داده‌ها، کیفیت برچسب‌گذاری، شیوع بیماری، تفاوت دستگاه‌ها و نحوه اعتبارسنجی نیز اهمیت اساسی دارند.

شاخص‌های ارزیابی

پژوهشگران چند شاخص کلیدی را بررسی کردند:

  • AUC برای سنجش توان تفکیک موارد مشکوک و غیرمشکوک.
  • دقت برای بررسی نسبت پیش‌بینی‌های صحیح در کل موارد.
  • حساسیت برای سنجش شناسایی درست موارد دارای بیماری.
  • ویژگی برای سنجش شناسایی درست موارد فاقد بیماری.
  • میزان نقص فنی برای ارزیابی پایداری عملکرد نرم‌افزار و فرآیند پردازش.
  • امتیاز ارزیابی بالینی برای بررسی میزان پذیرش و سودمندی سامانه از دیدگاه عملکرد بالینی.

نتایج اصلی مطالعه

بهبود توان تشخیصی سامانه

در طول دوره پایش، AUC سامانه ۱۰٫۸ درصد افزایش یافت و از ۰٫۸۳ به ۰٫۹۲ رسید. این تغییر نشان می‌دهد توانایی مدل برای تفکیک تصاویر دارای یافته‌های مشکوک از تصاویر بدون یافته قابل توجه بهتر شده است.

دقت سامانه نیز ۱۶٫۹ درصد افزایش داشت و از ۰٫۷۷ به ۰٫۹۰ رسید. البته دقت باید در کنار حساسیت، ویژگی و شیوع بیماری تفسیر شود؛ زیرا یک شاخص منفرد نمی‌تواند تمام ابعاد عملکرد بالینی یک سامانه را نشان دهد.

تغییر حساسیت و ویژگی

حساسیت از ۰٫۸۴ به ۰٫۸۸ افزایش یافت؛ یعنی سامانه در پایان دوره توانست نسبت بیشتری از موارد مثبت را شناسایی کند. ویژگی از ۰٫۷۰ به ۰٫۹۱ رسید که معادل افزایش ۳۰ درصدی گزارش‌شده در مطالعه است. افزایش ویژگی اهمیت بالینی دارد، زیرا می‌تواند تعداد نتایج مثبت کاذب، بررسی‌های تکمیلی غیرضروری و فشار کاری ناشی از ارجاع‌های اضافی را کاهش دهد.

با این حال، افزایش ویژگی نباید به قیمت کاهش حساسیت حاصل شود. در غربالگری سرطان پستان، از دست ندادن موارد واقعی بیماری اهمیت بسیار زیادی دارد. بنابراین، ارزیابی متوازن حساسیت و ویژگی برای تصمیم‌گیری درباره آستانه عملکرد سامانه ضروری است.

کاهش نقص‌های فنی

میانگین میزان نقص فنی از ۳ درصد به ۰٫۸ درصد کاهش یافت؛ یعنی کاهش ۲۶٫۷ درصدی بر اساس گزارش مقاله. نقص فنی می‌تواند شامل مشکلاتی در دریافت تصویر، سازگاری با سامانه‌های اطلاعاتی بیمارستان، پردازش ناقص، تأخیر در ارسال نتیجه یا عدم تولید خروجی قابل استفاده باشد.

این یافته نشان می‌دهد موفقیت هوش مصنوعی در تصویربرداری پزشکی فقط به دقت الگوریتم وابسته نیست. یک سامانه ممکن است از نظر علمی عملکرد مطلوبی داشته باشد، اما اگر با زیرساخت فناوری اطلاعات، دستگاه‌های تصویربرداری یا گردش کار مرکز سازگار نباشد، ارزش عملی محدودی خواهد داشت.

افزایش امتیاز ارزیابی بالینی

امتیاز ارزیابی بالینی از ۵۴٫۳۸ درصد به ۸۰٫۳۶ درصد افزایش پیدا کرد؛ افزایشی معادل ۴۷٫۸ درصد. این شاخص نشان می‌دهد برداشت بالینی از سودمندی سامانه در طول زمان بهتر شده است. بازخورد رادیولوژیست‌ها، اصلاح خطاهای نرم‌افزاری، بهبود رابط کاربری و سازگاری بیشتر با فرآیندهای کاری می‌توانند در چنین افزایشی نقش داشته باشند.

نقش رادیولوژیست در کنار هوش مصنوعی

در این مطالعه ۳۳۶ رادیولوژیست مشارکت داشتند. حضور متخصصان انسانی برای تفسیر نتایج، بررسی موارد دشوار، ارزیابی هشدارهای سامانه و شناسایی خطاهای الگوریتمی ضروری است. هوش مصنوعی در ماموگرافی باید به‌عنوان ابزار کمک‌تشخیصی دیده شود، نه جایگزین مسئولیت حرفه‌ای پزشک.

رادیولوژیست می‌تواند خروجی الگوریتم را در کنار علائم بالینی، سوابق بیمار، تصاویر قبلی و سایر بررسی‌ها تفسیر کند. همچنین بازخورد متخصصان به توسعه‌دهندگان کمک می‌کند مواردی مانند مثبت کاذب، منفی کاذب، خطاهای قطعه‌بندی و مشکلات رابط کاربری را شناسایی و اصلاح کنند.

اهمیت مطالعه برای نظام سلامت و بیمه درمانی

ادغام سامانه هوش مصنوعی در برنامه بیمه درمانی اجباری، این پژوهش را از یک مطالعه آزمایشگاهی فراتر می‌برد. در چنین برنامه‌ای، سامانه باید در مقیاس بزرگ، میان مراکز مختلف و با تجهیزات متنوع کار کند. همچنین باید از نظر پایداری، قابلیت اتصال به زیرساخت‌های اطلاعات سلامت، مدیریت داده، امنیت و پاسخ‌گویی حرفه‌ای قابل اتکا باشد.

نتایج مطالعه نشان می‌دهد یک مسیر مرحله‌ای شامل آزمون اولیه، پایش واقعی و بهبود تکرارشونده می‌تواند برای ورود فناوری‌های هوش مصنوعی به برنامه‌های رسمی سلامت مفید باشد. این مدل برای کشورهایی که قصد استفاده گسترده از هوش مصنوعی در غربالگری سرطان پستان دارند، قابل توجه است؛ هرچند انتقال مستقیم نتایج به ایران نیازمند اعتبارسنجی مستقل روی داده‌های ایرانی است.

محدودیت‌های علمی پژوهش

مهم‌ترین محدودیت مطالعه، کوچک بودن مجموعه‌داده آزمون کالیبراسیون گذشته‌نگر بود که تنها ۱۰۰ ماموگرافی را شامل می‌شد. چنین حجم محدودی ممکن است برای برآورد پایدار عملکرد در تمام گروه‌های سنی، انواع تراکم پستان و الگوهای مختلف بیماری کافی نباشد.

محدودیت دیگر، نبود اعتبارسنجی خارجی روی مجموعه‌داده‌های مستقل از مناطق یا کشورهای دیگر بود. تفاوت‌های جمعیتی، شیوع سرطان پستان، کیفیت تجهیزات، پروتکل‌های تصویربرداری و الگوهای ارجاع می‌توانند عملکرد الگوریتم را تغییر دهند. بنابراین، نمی‌توان نتایج این مطالعه را بدون آزمون مجدد به سایر کشورها یا جمعیت‌ها تعمیم داد.

همچنین، مقاله نشان می‌دهد که برخی از توسعه‌دهندگان سامانه مورد ارزیابی، کارمند شرکت ارائه‌دهنده فناوری بوده‌اند؛ هرچند بر اساس بیانیه مقاله، این افراد در اجرای مطالعه، تحلیل داده‌ها یا تفسیر نتایج مشارکت نداشته‌اند. شفافیت درباره این روابط برای ارزیابی مستقل و اعتماد علمی به نتایج اهمیت دارد.

پیامدهای احتمالی برای ایران

ایران نیز مانند بسیاری از کشورها با چالش‌هایی مانند افزایش حجم تصویربرداری، تفاوت دسترسی به رادیولوژیست‌های باتجربه، پراکندگی مراکز درمانی و ضرورت تشخیص زودهنگام سرطان پستان مواجه است. سامانه‌های هوش مصنوعی می‌توانند در اولویت‌بندی تصاویر، کنترل کیفیت، کاهش بار کاری و کمک به شناسایی موارد مشکوک نقش داشته باشند.

با این حال، استفاده ایمن از هوش مصنوعی در ماموگرافی نیازمند ایجاد مجموعه‌داده‌های بومی و چندمرکزی، برچسب‌گذاری استاندارد، ارزیابی روی دستگاه‌های مختلف و پایش مستمر پس از استقرار است. همچنین باید مسئولیت نهایی تصمیم پزشکی، نحوه ثبت خروجی الگوریتم در پرونده بیمار، امنیت داده‌های تصویری و سازوکار رسیدگی به خطاها مشخص شود.

جمع‌بندی

این مطالعه سه‌ساله نشان داد که ارزیابی چرخه عمر و پایش مداوم می‌تواند عملکرد یک سامانه هوش مصنوعی ماموگرافی را در محیط واقعی بهبود دهد. افزایش AUC از ۰٫۸۳ به ۰٫۹۲، رشد دقت تا ۰٫۹۰، بهبود حساسیت و ویژگی، کاهش نقص فنی و افزایش امتیاز ارزیابی بالینی، همگی نشان‌دهنده ارزش بالقوه این رویکرد هستند.

با وجود این، نتایج نباید به معنای جایگزینی رادیولوژیست یا اثبات عملکرد یکسان در همه جمعیت‌ها تلقی شود. هوش مصنوعی پزشکی زمانی می‌تواند به بهبود واقعی مراقبت کمک کند که با اعتبارسنجی مستقل، نظارت انسانی، امنیت داده و ارزیابی مداوم در فرآیند بالینی همراه باشد.

سوالات متداول

آیا هوش مصنوعی می‌تواند جایگزین رادیولوژیست در ماموگرافی شود؟

خیر. هوش مصنوعی در شرایط فعلی بیشتر به‌عنوان ابزار پشتیبان تصمیم‌گیری، اولویت‌بندی و کنترل کیفیت استفاده می‌شود. تفسیر نهایی باید با در نظر گرفتن وضعیت بالینی بیمار و سایر تصاویر و سوابق، توسط پزشک متخصص انجام شود.

مهم‌ترین نتیجه این مطالعه چه بود؟

مهم‌ترین نتیجه، بهبود عملکرد سامانه در طول پایش واقعی و پس از به‌روزرسانی‌های متوالی بود. AUC، دقت، حساسیت و ویژگی افزایش یافتند و هم‌زمان میزان نقص فنی کاهش پیدا کرد.

آیا نتایج این پژوهش مستقیماً برای ایران قابل استفاده است؟

نه به‌صورت مستقیم. نتایج می‌تواند برای طراحی مسیر پیاده‌سازی و پایش هوش مصنوعی در ایران آموزنده باشد، اما عملکرد سامانه باید روی داده‌های مستقل ایرانی، تجهیزات مورد استفاده در کشور و جمعیت‌های مختلف اعتبارسنجی شود.

افزایش ویژگی چه فایده‌ای برای بیماران دارد؟

افزایش ویژگی می‌تواند تعداد نتایج مثبت کاذب را کاهش دهد. در نتیجه، برخی ارجاع‌های غیرضروری برای تصویربرداری تکمیلی یا بررسی‌های بیشتر کمتر می‌شود؛ با این شرط که حساسیت برای شناسایی موارد واقعی بیماری حفظ شود.

چرا پایش پس از استقرار سامانه ضروری است؟

عملکرد هوش مصنوعی ممکن است با تغییر دستگاه‌ها، کیفیت داده‌ها، جمعیت بیماران، پروتکل‌های تصویربرداری و نسخه نرم‌افزار تغییر کند. پایش مستمر کمک می‌کند افت عملکرد یا افزایش خطاها زودتر شناسایی و اصلاح شوند.

درباره سانوس

سانوس، رسانه تخصصی هوش مصنوعی در سلامت، تلاش می‌کند پژوهش‌های معتبر پزشکی و فناوری‌های نوین سلامت را با زبانی علمی، دقیق و قابل استفاده برای مخاطب ایرانی بررسی کند. موضوع هوش مصنوعی در ماموگرافی نمونه‌ای از پیوند میان یادگیری ماشین، تصویربرداری پزشکی و سیاست‌گذاری سلامت است؛ حوزه‌ای که سانوس با تمرکز بر شواهد علمی، محدودیت‌های پژوهش و الزامات پیاده‌سازی ایمن آن را دنبال می‌کند.

مشخصات مقاله

  • عنوان انگلیسی: Implementation of an artificial intelligence-based system for mammography in the compulsory medical insurance program: results of a 3-year study
  • مجله: Quantitative Imaging in Medicine and Surgery
  • سال انتشار: ۲۰۲۶
  • DOI: 10.21037/qims-2026-0864
  • شناسه PubMed: 42701602
  • شناسه PMC: PMC13545622
  • نویسندگان فهرست‌شده در متن منبع: Denis Rumyantsev، Anton Vladzymyrskyy، Olga Omelyanskaya، Kirill Arzamasov، Alexander Bazhin، Lev Pestrenin، Larisa Rodionova، Ilya Naletov، Arina Varlamova، Valery Belotsky و Emilia Starikova

منبع مقاله

Quantitative Imaging in Medicine and Surgery. DOI: 10.21037/qims-2026-0864.

برای مشاهده مقاله رو دکمه زیر کلیک کنید

لینک های مفید