רק 3 מתוך 1,357 מכשירי AI רפואיים נבדקו לתועלת אמיתית
מחקר ב-PLOS Digital Health חושף שרק 3 מתוך 1,357 מכשירי AI רפואיים שאושרו בידי ה-FDA נבדקו כדי לבחון שיפור בבריאות המטופלים. החוקרים מדגישים שאישור רגולטורי לא מבטיח תועלת אמיתית, וקוראים למסגרת אימות קפדנית יותר כדי למנוע פערים בטיפול.

תארו לעצמכם: מתוך 1,357 מכשירי AI רפואיים שקיבלו אישור מה-FDA, רק שלושה נבדקו כדי לבחון אם הם באמת משפרים את בריאות המטופלים. זה מה שהמחקר החדש חושף, והוא מטלטל את היסודות של האופן שבו שוק הבריאות הדיגיטלית מתקדם.
מה המחקר מצא
החוקרים, בראשות Rawan Abulibdeh מאוניברסיטת טורונטו, פרסמו את הממצאים ב-PLOS Digital Health באוגוסט 2026. הם ניתחו את כל המכשירים המבוססים על בינה מלאכותית שאושרו בידי ה-FDA עד 5 בדצמבר 2025. התוצאה? מתוך 1,357 מכשירים:
- רק 34 (פחות מ-3%) קושרו לניסויים קליניים רשומים.
- רק 12 מתוכם פרסמו תוצאות ב-ClinicalTrials.gov.
- 12 מאמרים עברו ביקורת עמיתים.
- ורק שלושה מכשירים (0.2%) נבדקו כדי לבחון תוצאות מרכזיות למטופלים, כמו תמותה, שבץ, אשפוזים ואיכות חיים.
אז מה בעצם קרה כאן?
כדי לקבל אישור מה-FDA, מכשירים צריכים רק להראות "שוויון מהותי" למכשיר קיים שכבר נמצא בשוק. היזמים לא נדרשים להוכיח שה-AI החדש עוזר למטופלים לחיות חיים בריאים יותר — מה שמוביל לפיתוח מהיר על חשבון הקפדנות. "ציפינו שבסיס הראיות יהיה דק, אבל לא עד כדי כך", אמרו החוקרים. "אישור אומר לך שמכשיר דומה למשהו שכבר קיים. הוא לא אומר לך שהוא עוזר למישהו."
הבעיות החמורות
רוב המחקרים נערכו במערכות בריאות עתירות משאבים, כמו בארה"ב, והוציאו מהמחקר קבוצות מפתח כמו נשים בהיריון, מבוגרים מעל גיל 75 ודוברי אנגלית. החוקרים מזהירים שהפער הזה עלול להרחיב פערים בבריאות. לדוגמה:
- מודל ה-Epic Sepsis החמיץ 67% ממקרי הספסיס, אף שהתריע רק ב-18% מהאשפוזים.
- IBM Watson for Oncology הראה שיעורי התאמה עם המלצות מומחים נמוכים עד כדי 12% לסרטן קיבה בסין ו-33% בדנמרק.
בנוסף, מדינות בעלות הכנסה נמוכה ובינונית עלולות להפוך לאוכלוסיות ניסוי מבלי משים, כי הן מסתמכות על אישורים ממדינות עשירות.
מה הלאה? מסגרת חדשה
בתגובה, הציעו החוקרים מסגרת תלת-שלבית לאימות:
- אימות רטרוספקטיבי על מערכי נתונים מגוונים ומייצגים.
- מחקרים פרוספקטיביים המשולבים בזרימת העבודה, עם לפחות 500 משתתפים ונקודות קצה מוגדרות מראש לבטיחות ולשימושיות.
- ניסויים רב-מרכזיים עם לפחות 2,000 משתתפים, שבודקים תוצאות מרכזיות למטופלים ותתי-אוכלוסיות רלוונטיות.
מה זה אומר לכם, אנשי ההיי-טק?
אם אתם עובדים בפיתוח AI או בבריאות דיגיטלית, אתם יודעים כמה קשה לבצע ניסויים כאלה — הם יקרים, דורשים זמן, והטכנולוגיה משתנה במהירות. אבל בלי זה, אנחנו בסיכון להטמיע כלים שלא עושים שום דבר, או אפילו מזיקים. זה לא רק עניין רגולטורי; זה עניין של בטיחות מטופלים ושל אמון הציבור בטכנולוגיה.
אז בפעם הבאה שאתם שומעים על מכשיר AI רפואי חדש שקיבל אישור, זכרו: אישור לא שווה תועלת.