Science
18개 장기·146개 소견 평균 AUC 0.913 기록 의사와 협업 시 민감도 약 10%포인트 상승

중국 연구진이 복부 CT 영상을 판독하는 범용 인공지능(AI) 모델을 개발해 다수 방사선과 의사를 웃도는 진단 성능을 확인했다.
저장(浙江)대학 량팅보(梁廷波) 교수팀은 17일(현지시간) 국제학술지 사이언스(Science)에 '복부 CT 진단을 위한 전문가 수준 범용 AI'라는 제목의 연구 논문을 발표했다.
연구진이 개발한 모델 '레이더(RADAR)'는 기존 AI 진단 방식과 달리 병변을 일일이 표시하지 않고, 이미 작성된 구조화 판독 보고서를 학습 신호로 활용한다.
훈련 데이터는 40만 건이 넘는 조영증강 복부 CT 검사에서 추출한 1500만 개의 '해부 구조-영상-텍스트' 조합이다.
모델은 같은 환자의 CT 영상 조각과 보고서 속 진단 문장을 가깝게, 다른 환자의 정보는 멀게 배치하는 대조 학습 방식으로 훈련됐다.
간·췌장·위·소장·신장 등 18개 해부 구조를 개별적으로 분리해 정교하게 정렬함으로써 전체 영상과 보고서만으로는 얻기 어려운 세부 연관성까지 학습했다.
성능 평가에서 레이더는 실제 진료 환경에 가까운 약 4만 건의 내부 데이터에서 18개 부위, 146개 영상 소견에 대해 평균 0.913의 곡선하면적(AUC)을 기록했다.
8개 외부 의료기관 데이터에서도 AUC가 0.874~0.912로 나타나 병원과 스캐너가 달라져도 성능 저하가 크지 않았다.
병리 검사로 확진된 간암·췌장암·위암·대장암에서는 AUC가 0.891~0.984에 달했다.
훈련 과정에서 의도적으로 제외한 급성 복통 관련 질환에서도 AUC 0.904를 기록해 처음 보는 질환을 판별하는 '제로샷' 일반화 능력을 보였다.
14개 기관의 방사선과 의사 26명이 참여한 판독 시험에서는 레이더 단독 성능이 다수 의사보다 높았다.
의사가 AI의 도움을 받으면 민감도가 약 10%포인트 상승해 사람과 기계의 협업이 가장 우수한 결과를 냈다.
레이더는 판독 근거가 되는 영상 부위를 표시하는 주의 지도(attention map)도 출력해 의사가 AI의 판단 이유를 확인할 수 있게 했다.
다만 연구진은 출혈량이 적거나 층 구분이 불분명한 경우, 보고서에 체계적 편향이 있는 경우에는 오류 가능성이 있다고 밝혔다.
조영제 알레르기, 다양한 촬영 시기, 희귀 질환, 비조영 CT 등에 대해서도 추가 훈련이 필요하다고 덧붙였다.
연구진은 레이더가 방사선과 의사를 대체하기보다 "고감도의 제2의 눈"에 가깝다고 평가했다.

BIOBOOK TEAM
biobookmedia@biobook.co.kr