هوش مصنوعی برای پیشبینی خونریزی پس از زایمان؛ چرا اعتبارسنجی خارجی مدلهای یادگیری ماشین حیاتی است؟

خونریزی پس از زایمان یکی از مهمترین فوریتهای مامایی و از علل اصلی عوارض شدید و مرگومیر مادران در جهان است. پژوهش تازهای که در مجله Pregnancy منتشر شده، عملکرد یک مدل یادگیری ماشین را برای پیشبینی خونریزی پس از زایمان در دادههای واقعی هشت بیمارستان در شمالشرق ایالات متحده بررسی کرده است. پیام مرکزی این مطالعه برای پزشکی دیجیتال و هوش مصنوعی در سلامت روشن است: مدلی که در یک مجموعهداده عملکرد بسیار خوبی دارد، لزوماً در بیمارستانها، جمعیتها و سامانههای پرونده الکترونیک سلامت دیگر به همان اندازه دقیق عمل نمیکند.
خلاصه سریع
- این مطالعه بهصورت کوهورت گذشتهنگر، 87,662 زایمان را در هشت بیمارستان یک شبکه درمانی بزرگ در شمالشرق آمریکا بررسی کرد.
- میزان بروز خونریزی پس از زایمان در جمعیت مطالعه 7.7 درصد بود.
- مدل اصلی Consortium for Safe Labor یا CSL که قبلاً برای پیشبینی خونریزی پس از زایمان توسعه یافته بود، در اعتبارسنجی خارجی فقط عملکرد تمایزدهندگی متوسطی داشت.
- مساحت زیر منحنی ROC یا AUC مدل اصلی در دادههای جدید 0.60 با فاصله اطمینان 95 درصدی 0.58 تا 0.61 بود.
- بازآموزی محلی مدل با الگوریتم XGBoost و با استفاده از همان ویژگیهای اولیه، AUC را به 0.75 با فاصله اطمینان 95 درصدی 0.74 تا 0.76 افزایش داد.
- با وجود بهبود AUC، مدل بازآموزیشده خطر خونریزی پس از زایمان را در دامنهای از احتمالات پیشبینیشده بیشبرآورد میکرد؛ بنابراین کالیبراسیون مدل همچنان یک چالش مهم بود.
- نتیجه بالینی مطالعه این است که پیش از استفاده از مدلهای هوش مصنوعی در زایشگاه، اعتبارسنجی خارجی، سازگارسازی محلی، ارزیابی کالیبراسیون و پایش مستمر ضروری هستند.
تعاریف ضروری
خونریزی پس از زایمان چیست؟
خونریزی پس از زایمان یا Postpartum Hemorrhage که به اختصار PPH نامیده میشود، خونریزی شدید پس از تولد نوزاد است. در این پژوهش، PPH بهصورت از دست دادن خون تخمینی برابر یا بیش از 1000 میلیلیتر در زمان زایمان، یا نیاز به تزریق خون طی 24 ساعت پس از زایمان تعریف شد. این تعریف، موارد بالینی مهمتر و شدیدتر را هدف میگیرد؛ مواردی که میتوانند به شوک خونریزیدهنده، نیاز به مداخلات جراحی، بستری در مراقبت ویژه، اختلال عملکرد اندامها و در موارد شدید، مرگ مادر منجر شوند.
علل خونریزی پس از زایمان اغلب با چهار گروه شناختهشده در مامایی توضیح داده میشوند: ضعف انقباض رحم، باقیماندن بافت جفتی، آسیبهای کانال زایمان و اختلالات انعقادی. با این حال، خطر واقعی هر بیمار حاصل برهمکنش پیچیده عوامل مامایی، سوابق پزشکی، یافتههای آزمایشگاهی، علائم حیاتی، نوع زایمان، مشخصات جفت و وضعیت جنین است. همین پیچیدگی، زمینه مناسبی برای استفاده محتاطانه از مدلهای یادگیری ماشین فراهم میکند.
یادگیری ماشین در سلامت مادر چیست؟
یادگیری ماشین شاخهای از هوش مصنوعی است که با تحلیل الگوهای موجود در دادهها، برای پیشبینی یک پیامد در افراد جدید بهکار میرود. در پزشکی مادر و جنین، این مدلها میتوانند دادههای متنوعی مانند سن مادر، شاخص توده بدنی، بیماریهای همراه، سابقه مامایی، نتایج آزمایش خون، علائم حیاتی و تشخیصهای ثبتشده در پرونده الکترونیک سلامت را ترکیب کنند تا احتمال وقوع یک رویداد مانند خونریزی پس از زایمان را برآورد کنند.
هدف از چنین پیشبینیای جایگزینکردن متخصص زنان، ماما یا متخصص بیهوشی نیست. ارزش بالقوه آن در تقویت تصمیمگیری بالینی است؛ برای مثال، شناسایی زودتر بیماری که شاید به آمادهسازی خون و فرآوردههای خونی، حضور تیم باتجربهتر، کنترل دقیقتر علائم حیاتی، دسترسی سریعتر به داروهای انقباضدهنده رحم یا برنامهریزی برای زایمان در مرکز مجهزتر نیاز داشته باشد.
اعتبارسنجی خارجی مدل هوش مصنوعی چیست؟
اعتبارسنجی خارجی یعنی آزمودن یک مدل پیشبینی در دادههایی که برای ساخت مدل استفاده نشدهاند؛ دادههایی که ممکن است متعلق به بیمارستان، منطقه جغرافیایی، بازه زمانی یا جمعیت کاملاً متفاوتی باشند. این مرحله نشان میدهد آیا مدل واقعاً قابل تعمیم است یا فقط الگوهای خاص دادههای اولیه را یاد گرفته است.
در هوش مصنوعی پزشکی، عملکرد خوب در توسعه اولیه مدل کافی نیست. تفاوت در ترکیب جمعیتی بیماران، استانداردهای ثبت پرونده، کدگذاری تشخیصها، روش تخمین خونریزی، پروتکلهای زایمان، کیفیت دادهها و سیاستهای انتقال خون میتواند عملکرد مدل را بهطور قابل توجهی تغییر دهد.
AUC و کالیبراسیون چه تفاوتی دارند؟
AUC یا مساحت زیر منحنی مشخصه عملکرد گیرنده، توانایی مدل را در تفکیک افراد دارای پیامد از افراد بدون پیامد نشان میدهد. AUC برابر 0.50 تقریباً معادل عملکرد تصادفی است و هرچه عدد به 1 نزدیکتر باشد، قدرت تمایز بهتر است. در این مطالعه، AUC مدل اصلی 0.60 بود؛ یعنی مدل فقط توانایی محدودی برای رتبهبندی بیماران برحسب خطر خونریزی داشت. مدل بازآموزیشده با AUC برابر 0.75 عملکرد تفکیکی بهتری نشان داد.
کالیبراسیون مفهومی متفاوت و برای کاربرد بالینی بسیار مهم است. کالیبراسیون بررسی میکند که آیا احتمال پیشبینیشده با احتمال واقعی رخداد مطابقت دارد یا نه. برای نمونه، اگر مدل به 100 بیمار خطر 20 درصدی بدهد، در حالت ایدهآل باید حدود 20 نفر واقعاً دچار پیامد شوند. مدلی ممکن است AUC خوب داشته باشد، اما اگر خطر را بهصورت سیستماتیک بیشبرآورد یا کمبرآورد کند، برای تصمیمگیریهای بالینی حساس مشکلساز خواهد بود.
مدل هوش مصنوعی برای پیشبینی خونریزی پس از زایمان چگونه ارزیابی شد؟
هدف پژوهش
هدف مطالعه، ارزیابی خارجی مدل پیشبینی PPH متعلق به Consortium for Safe Labor در یک شبکه درمانی بزرگ آمریکایی بود. مدل اصلی CSL پیشتر با دادههای یک کنسرسیوم آمریکایی توسعه یافته بود و از اطلاعات در دسترس هنگام پذیرش بیمار در بخش زایمان استفاده میکرد. پژوهشگران میخواستند بدانند آیا این مدل در محیط معاصر و در دادههای پرونده الکترونیک سلامت یک شبکه دیگر نیز عملکرد قابل قبولی دارد یا خیر.
پرسش دوم پژوهش نیز بسیار کاربردی بود: اگر همین متغیرهای اولیه در محیط جدید و با الگوریتم برتر مدل اصلی، یعنی XGBoost، دوباره آموزش داده شوند، آیا عملکرد مدل بهبود پیدا میکند؟ این سؤال به موضوع مهم «سازگارسازی محلی» یا local adaptation در هوش مصنوعی بالینی مربوط است.
طراحی مطالعه و جامعه آماری
این پژوهش یک مطالعه کوهورت گذشتهنگر بود که زایمانهای ثبتشده از ماه مه 2015 تا ماه مه 2024 را در هشت بیمارستان یک سامانه سلامت بزرگ در شمالشرق ایالات متحده بررسی کرد. دادهها از پرونده الکترونیک سلامت استخراج شدند. در مجموع، 87,662 زایمان در تحلیل قرار گرفتند؛ حجم نمونهای که امکان ارزیابی نسبتاً پایدار عملکرد مدل را فراهم میکند.
از میان این زایمانها، 7.7 درصد با تعریف مطالعه از خونریزی پس از زایمان مطابقت داشتند. این میزان نشان میدهد که PPH در یک سامانه درمانی واقعی، رویدادی نادر اما نه بسیار نادر است و همین ویژگی از نظر طراحی مدلهای پیشبینی اهمیت دارد. در پیامدهای با شیوع پایین، انتخاب آستانه تصمیم، توازن میان حساسیت و ویژگی، و ارزش بالینی هشدارهای مدل باید با دقت بیشتری بررسی شود.
دادهها و متغیرهای ورودی مدل
پژوهشگران از همان دسته متغیرهایی استفاده کردند که در آموزش مدل اصلی CSL بهکار رفته بود. این متغیرها در زمان پذیرش برای زایمان از پرونده الکترونیک سلامت در دسترس بودند و شامل حوزههای زیر میشدند:
- اطلاعات جمعیتشناختی و اجتماعی.
- تشخیصهای بالینی و بیماریهای همراه مادر.
- سابقه خانوادگی.
- نتایج آزمایشگاهی.
- علائم حیاتی ثبتشده هنگام پذیرش در بخش لیبر و دلیوری.
تکیه بر دادههای موجود در لحظه پذیرش یک انتخاب مهم طراحی است. اگر مدل بتواند پیش از وقوع خونریزی، بیماران پرخطر را شناسایی کند، احتمال دارد تیم درمان برای پیشگیری و آمادگی عملیاتی فرصت بیشتری داشته باشد. با این حال، محدودکردن مدل به دادههای زمان پذیرش نیز ممکن است بخشی از اطلاعات مهمی را که در طول فرایند زایمان ایجاد میشوند، کنار بگذارد.
الگوریتم XGBoost در پزشکی
XGBoost یا Extreme Gradient Boosting یکی از الگوریتمهای قدرتمند یادگیری ماشین برای دادههای ساختاریافته است. این روش مجموعهای از درختهای تصمیم را بهصورت مرحلهای میسازد؛ بهگونهای که هر مرحله تلاش میکند خطاهای مراحل قبل را اصلاح کند. XGBoost میتواند روابط غیرخطی، تعامل میان متغیرها و الگوهای پیچیده را بهتر از بسیاری از مدلهای آماری ساده شناسایی کند.
با وجود این مزیت، توان مدلهای پیچیده به کیفیت داده، تعاریف بالینی یکسان، کنترل نشت داده، مدیریت دادههای گمشده و اعتبارسنجی دقیق وابسته است. همچنین پیچیدگی الگوریتم نباید باعث نادیدهگرفتن اصول بنیادی ایمنی بیمار، تفسیرپذیری و نظارت انسانی شود.
نتایج اصلی: افت عملکرد در اعتبارسنجی خارجی
عملکرد مدل اصلی CSL
مدل اصلی CSL در دادههای خارجی سامانه جدید، AUC برابر با 0.60 داشت؛ فاصله اطمینان 95 درصدی این برآورد بین 0.58 تا 0.61 بود. این سطح از عملکرد، تمایزدهندگی متوسط و محدود را نشان میدهد. به بیان ساده، مدل در تفکیک بیمارانی که دچار خونریزی پس از زایمان میشدند از بیمارانی که این پیامد را نداشتند، بهمراتب ضعیفتر از انتظار یک ابزار بالینی مستقل عمل کرد.
این یافته الزاماً به این معنا نیست که مدل اولیه بیارزش بوده است. بلکه نشان میدهد عملکرد یک مدل، ویژگی ثابت و مستقل از محیط نیست. مدلی که در دادههای توسعه عملکرد بالایی دارد ممکن است با تغییر محیط درمانی، جمعیت و فرایند ثبت اطلاعات، دچار افت چشمگیر شود. این پدیده در علم داده با عنوان تغییر توزیع داده یا dataset shift شناخته میشود.
بازآموزی محلی و بهبود AUC
پژوهشگران سپس با استفاده از همان مجموعه ویژگیهای مدل اولیه، یک مدل جدید XGBoost را بر اساس دادههای محلی بازآموزی کردند. این مدل AUC برابر 0.75 با فاصله اطمینان 95 درصدی 0.74 تا 0.76 به دست آورد. اختلاف میان AUC 0.60 و 0.75 نشان میدهد که بازتنظیم مدل براساس ویژگیهای محلی، الگوهای جمعیت هدف و واقعیتهای ثبت داده میتواند بهطور معناداری قدرت تفکیک را ارتقا دهد.
اما AUC برابر 0.75 نیز به معنای مدل کامل نیست. این رقم نشاندهنده قدرت تمایز قابل قبول تا خوب در سطح پژوهشی است، ولی برای استفاده عملی در زایشگاه باید همراه با بررسی حساسیت، ویژگی، ارزش اخباری مثبت، ارزش اخباری منفی، آستانههای هشدار، بار کاری ایجادشده برای تیم درمان و پیامدهای ناشی از هشدارهای کاذب ارزیابی شود.
مسئله مهم کالیبراسیون: خطر بیشبرآوردشده
تحلیل کالیبراسیون نشان داد مدل بازآموزیشده در طیفی از احتمالات پیشبینیشده، خطر PPH را بیشبرآورد میکرد. این یافته بسیار مهم است، زیرا یک مدل میتواند افراد پرخطر را نسبتاً خوب رتبهبندی کند اما احتمال واقعی خطر را نادرست گزارش دهد.
برای مثال، اگر مدل خطر بیمار را بالاتر از مقدار واقعی تخمین بزند، ممکن است باعث افزایش هشدارهای غیرضروری، استفاده نامتناسب از منابع، اضطراب بیمار و کارکنان یا خستگی ناشی از هشدار شود. در مقابل، کمبرآوردی خطر نیز میتواند به از دست رفتن فرصتهای پیشگیری منجر شود. بنابراین، پیش از استقرار مدل در محیط بالینی، بازکالیبراسیون و تعیین آستانههای تصمیم متناسب با ظرفیت و پروتکل هر مرکز ضروری است.
اهمیت بالینی و عملی برای زایشگاهها
هوش مصنوعی باید مکمل قضاوت بالینی باشد
در محیط پرتنش زایشگاه، مدل پیشبینی خطر میتواند نقش یک ابزار پشتیبان تصمیمگیری بالینی را ایفا کند، نه یک مرجع مستقل برای تصمیمگیری. متخصص زنان، ماما، متخصص بیهوشی و تیم خون باید همچنان شرایط بالینی لحظهای بیمار، روند زایمان، یافتههای معاینه، سابقه خونریزی و نشانههای هشدار را در مرکز تصمیمگیری قرار دهند.
بهترین کاربرد احتمالی چنین مدلهایی، کمک به استانداردسازی آمادگی تیمی است. برای بیمارانی که طبق ترکیب ارزیابی بالینی و مدل در خطر بالاتر قرار میگیرند، مرکز درمانی میتواند درباره آمادهسازی مسیر وریدی مناسب، بررسی گروه خونی و غربالگری آنتیبادی، دسترسی سریع به فرآوردههای خونی، آمادگی داروها و تجهیزات کنترل خونریزی، و هماهنگی زودهنگام میان تیمهای مختلف تصمیمگیری کند.
چرا دادههای پرونده الکترونیک سلامت چالشبرانگیز هستند؟
پرونده الکترونیک سلامت منبعی ارزشمند اما ناهمگون است. ممکن است یک تشخیص در بیمارستانی بهصورت ساختاریافته ثبت شود و در مرکز دیگر فقط در متن بالینی وجود داشته باشد. زمان ثبت علائم حیاتی، واحدهای آزمایشگاهی، شیوه کدگذاری، تکمیلبودن اطلاعات و حتی تعریف عملیاتی خونریزی پس از زایمان میتواند میان مراکز متفاوت باشد.
علاوه بر این، تغییر دستورالعملهای بالینی در طول زمان بر دادهها اثر میگذارد. برای مثال، تغییر در نحوه سنجش خون از دسترفته، اجرای برنامههای ایمنی خونریزی مامایی یا تغییر آستانه انتقال خون ممکن است باعث شود پیامد ثبتشده در دورههای مختلف یا بیمارستانهای مختلف دقیقاً یک مفهوم یکسان نداشته باشد. این عوامل میتوانند باعث افت قابلیت تعمیم یک مدل هوش مصنوعی شوند.
تحلیل SHAP و تفسیرپذیری مدل
پژوهشگران اهمیت ویژگیها را با شاخص mean feature gain و مقادیر SHAP بررسی کردند. SHAP روشی برای توضیح مدلهای یادگیری ماشین است که نشان میدهد هر متغیر بهطور متوسط تا چه اندازه در جهت افزایش یا کاهش پیشبینی مدل نقش داشته است. این نوع تحلیل میتواند به تیمهای بالینی کمک کند تا از مدلهای کاملاً جعبهسیاه فاصله بگیرند و بفهمند کدام دسته از اطلاعات بیشترین نقش را در پیشبینی ایفا میکنند.
با این حال، اهمیت یک متغیر در مدل به معنای علتبودن آن نیست. یک ویژگی ممکن است بهدلیل ارتباط با عوامل دیگری که مستقیماً اندازهگیری نشدهاند، برای پیشبینی مفید باشد. بنابراین نتایج تفسیرپذیری مدل نباید بهتنهایی مبنای نتیجهگیری علّی یا تغییر درمان قرار گیرند.
پیامهای کلیدی برای توسعه هوش مصنوعی پزشکی در ایران
این پژوهش برای سامانههای سلامت ایران نیز یک پیام مهم دارد. انتقال مستقیم یک مدل خارجی به بیمارستانهای ایرانی، حتی اگر در یک مطالعه بینالمللی بسیار دقیق به نظر برسد، رویکردی ایمن و علمی نیست. ترکیب جمعیتی مادران، الگوی بیماریهای همراه، نرخ سزارین، دسترسی به خون، کیفیت ثبت اطلاعات، پروتکلهای پیشگیری و درمان خونریزی، و ساختار پرونده الکترونیک سلامت در ایران با کشورهای دیگر تفاوت دارد.
برای توسعه هوش مصنوعی در مامایی و سلامت مادر در ایران، مسیر مسئولانه باید شامل ایجاد دادههای باکیفیت و استاندارد، تعریف یکسان پیامدها، اعتبارسنجی چندمرکزی، ارزیابی سوگیری احتمالی، بررسی کالیبراسیون، طراحی گردش کار بالینی، حفاظت از محرمانگی دادههای مادر و نوزاد، و پایش عملکرد مدل پس از استقرار باشد. ابزار پیشبینی باید در کنار پروتکلهای بالینی و نه بهجای آنها استفاده شود.
محدودیتها و نکات احتیاطی در تفسیر مطالعه
- مطالعه گذشتهنگر بود؛ بنابراین به کیفیت، کاملبودن و صحت ثبت دادهها در پرونده الکترونیک سلامت وابسته است.
- ارزیابی در یک شبکه درمانی در شمالشرق آمریکا انجام شد و نتایج آن لزوماً به همه بیمارستانها، کشورها و جمعیتها قابل تعمیم نیست.
- تعریف PPH بر اساس خونریزی تخمینی یا انتقال خون است و هر دو شاخص میتوانند تحت تأثیر شیوه ثبت و تصمیمهای بالینی قرار بگیرند.
- بهبود AUC پس از بازآموزی محلی بهتنهایی برای استقرار بالینی کافی نیست، زیرا کالیبراسیون مدل بازآموزیشده مطلوب کامل نبود.
- پژوهش نشان میدهد مدل در دادههای محلی بهتر عمل کرده، اما اثربخشی واقعی آن بر کاهش خونریزی شدید، انتقال خون، بستری در ICU یا مرگ مادر در یک کارآزمایی مداخلهای بررسی نشده است.
سوالات متداول
آیا مدل هوش مصنوعی میتواند خونریزی پس از زایمان را با قطعیت پیشبینی کند؟
خیر. مدلهای پیشبینی، احتمال خطر را تخمین میزنند و قطعیت ایجاد نمیکنند. حتی مدلی با عملکرد خوب ممکن است برخی موارد را از دست بدهد یا برای برخی بیماران هشدار کاذب صادر کند. تصمیم نهایی باید بر اساس ارزیابی بالینی تیم درمان گرفته شود.
AUC برابر 0.75 چه معنایی دارد؟
این عدد نشان میدهد مدل در مقایسه زوجی میان یک بیمار مبتلا به PPH و یک بیمار بدون PPH، در حدود 75 درصد موارد بیمار پرخطر را رتبه بالاتری میدهد. با این حال، AUC بهتنهایی درباره دقت احتمال خطر، مناسببودن آستانه هشدار یا سود واقعی بالینی اطلاعات کامل نمیدهد.
چرا مدل اصلی در بیمارستانهای جدید ضعیفتر عمل کرد؟
تفاوت در جمعیت بیماران، روش ثبت دادهها، الگوی مراقبت مامایی، تعریف و اندازهگیری خونریزی، کیفیت پرونده الکترونیک سلامت و تغییرات زمانی در مراقبتها میتواند باعث شود روابطی که مدل در داده اولیه یاد گرفته است، در محیط جدید برقرار نباشند.
آیا بازآموزی محلی مدل همیشه راهحل مناسبی است؟
بازآموزی محلی میتواند عملکرد را بهبود دهد، همانطور که در این مطالعه AUC از 0.60 به 0.75 رسید. با این حال، به داده کافی و باکیفیت، ارزیابی مستقل، کنترل سوگیری، کالیبراسیون، نظارت مداوم و زیرساخت حاکمیت داده نیاز دارد. بازآموزی بدون اعتبارسنجی دقیق ممکن است خطر بیشبرازش را افزایش دهد.
آیا این مدلها جایگزین پروتکلهای خونریزی مامایی میشوند؟
خیر. ارزش بالقوه مدلهای یادگیری ماشین در تقویت اجرای پروتکلهای ایمنی، شناسایی زودتر بیماران نیازمند آمادگی بیشتر و کمک به تخصیص منابع است. این ابزارها باید درون یک نظام بالینی استاندارد و با نظارت متخصصان به کار گرفته شوند.
درباره سانوس
سانوس با تمرکز بر پیوند میان هوش مصنوعی، دادههای سلامت و پزشکی مبتنی بر شواهد، تلاش میکند یافتههای پژوهشی پیچیده را به دانشی قابل استفاده برای پزشکان، مدیران سلامت، پژوهشگران و مخاطبان فارسیزبان تبدیل کند. این مطالعه نمونهای مهم از رویکردی است که سانوس بر آن تأکید دارد: ارزش هوش مصنوعی در سلامت نه فقط در ساخت مدلهای دقیق، بلکه در اعتبارسنجی علمی، شفافیت، ایمنی بیمار، انطباق با محیط محلی و نظارت مداوم بر عملکرد آنهاست.
منبع مقاله
Pregnancy (Hoboken)، منتشرشده توسط Wiley Periodicals LLC از طرف Society for Maternal-Fetal Medicine، سال 2025.
عنوان مقاله: External validation of a machine learning model to predict postpartum hemorrhage in a US northeastern healthcare system
نویسنده نخست: Vesela P. Kovacheva و همکاران
شناسه DOI: 10.1002/pmf2.70200
برای مشاهده مقاله رو دکمه زیر کلیک کنید