특히 기존 AI가 의료기관별 약어나 판독문 작성 방식의 차이로 정확도가 떨어지는 한계를 보였다면, 이번 모델은 거대언어모델(LLM)을 활용해 비정형 판독문에서도 성능을 유지했다. 실제 영상과 판독문을 검색해 제시해 결과의 근거를 확인할 수 있다는 점도 특징이다.
서울대병원 영상의학과 박창민·이동헌 교수 연구팀(제1저자 고한빈 연구원)은 공개 데이터와 서울대병원 임상자료 등 약 160만건의 영상-판독문 쌍을 학습한 흉부 X선 양방향 검색 AI 모델을 개발했다고 26일 밝혔다.

흉부 X선 판독문은 같은 소견이라도 의료기관이나 의사에 따라 약어와 표현이 다르고 작성 방식에도 편차가 크다. 이에 기존 BERT 기반 AI는 영상과 판독문을 정확하게 연결하는 데 한계가 있었다.
연구팀은 BERT 대신 LLM을 문장 인코더로 활용해 앞뒤 문맥을 함께 파악하도록 했다. 새로운 판독문을 생성하는 대신 기존 판독문 가운데 영상과 의미적으로 가장 가까운 내용을 찾아주는 ‘검색형 AI’를 구현한 것이다.
이를 기반으로 개발한 ‘LLM2CLIP4CXR’에 서울대병원 비식별 자료와 MIMIC-CXR, CheXpert-plus, PadChest 등 공개 데이터셋을 포함한 총 160만여건의 영상-판독문 쌍을 학습시켰다.
검증 결과 자체 데이터에서 임상 정확도를 나타내는 GREEN 점수는 0.308로 비교 모델 중 가장 높았으며, 외부 데이터에서는 0.618을 기록했다. 정답을 첫 번째 검색 결과에서 찾은 비율도 4.9%로 검색 기반 비교 모델 최고치인 2.9%를 웃돌았다.
특히 약어가 많거나 결론 위주로 작성된 판독문에서도 성능이 유지됐으며, 흉부영상 전문의가 실시한 72개 증례 평가에서는 76%가 연구팀 모델의 결과를 1순위로 선택했다.

연구팀은 향후 해당 기술을 의료영상저장전송시스템(PACS)이나 영상정보시스템(RIS)에 적용해 과거 검사나 유사 증례를 의미 기반으로 검색하는 데 활용할 수 있을 것으로 기대하고 있다. 특히 실제 존재하는 영상과 판독문을 제시하는 만큼 의료진이 결과의 근거를 직접 확인할 수 있다는 장점이 있다.
박창민 교수는 “의료 AI의 성능은 데이터양보다 문맥과 임상 지식을 얼마나 깊이 있게 이해하느냐에 달려 있다”며 “이런 검색 방식은 결과의 근거를 추적할 수 있다는 장점이 있다”고 강조했다.
이동헌 교수는 “이번 연구로 비정형 판독문도 원형 그대로 활용할 수 있는 길을 열었다”며 “향후 흉부 CT 등으로 범위를 넓히고 실제 진료 현장의 유용성을 확인하는 다기관 후속 검증 작업을 추진할 계획”이라고 밝혔다.
한편 이번 연구는 국제학술지 ‘IEEE Journal of Biomedical and Health Informatics(JBHI)’에 게재됐다.