블로그

유유테이진의
건강 정보 블로그

의료용 AI

의료 AI 임상연구의 정답 기준, 누가 정했는지 읽는 법

2026-09-14
#의료 AI 임상근거 #정답 기준 #참조표준 #전문가 합의 #병리 결과 #추적관찰 #AI 연구 설계 #진단 정확도 연구 #STARD-AI

안녕하세요, 유유테이진 건강지킴이입니다.

의료 AI의 성능 자료에서 민감도와 특이도 수치가 높아 보여도, 먼저 확인할 질문이 있습니다. AI가 맞았는지 틀렸는지를 판단한 ‘정답’은 무엇이었는가입니다. 진단 정확도 연구에서는 이를 ‘참조표준(reference standard)’이라고 합니다. 참조표준이 달라지면 같은 AI라도 성능 수치의 의미와 실제 적용 가능성이 달라질 수 있습니다.

TL;DR

  • 참조표준은 연구 참여자에게 목표 상태가 있는지 없는지를 정하는 기준입니다.
  • 병리 결과, 전문가 판독, 다수 전문가 합의, 일정 기간의 추적관찰 결과 등 연구마다 정답 기준이 다를 수 있습니다.
  • 논문이나 제조사 자료를 볼 때는 성능 수치보다 먼저 정답의 종류, 판정 기준, 판정 주체, 연구 전 결정 여부를 확인해야 합니다.
  • 민감도·특이도는 AI에 고정된 숫자가 아닙니다. 대상 집단, 임상 환경, 중증도, 참조표준 정의에 따라 달라질 수 있습니다.

참조표준은 왜 성능 해석의 출발점일까

진단 정확도 연구에서 AI 결과는 참조표준과 비교됩니다. 즉, AI가 어떤 결과를 냈는지만 보는 것이 아니라 연구에서 정한 기준과 얼마나 일치했는지를 평가하는 구조입니다.

진단 정확도 연구 보고지침인 STARD는 하나의 상태에도 여러 참조표준이 가능하다고 설명합니다. 연구자는 왜 해당 기준을 선택했는지 제시해야 하며, 그 이유는 검사의 사용 목적, 임상적 관련성, 실무상 가능성 또는 윤리적 고려에 따라 달라질 수 있습니다.

따라서 “정확도가 높다”는 문장만으로는 충분하지 않습니다. 병리 결과와 비교한 것인지, 한 명 또는 여러 전문의의 판독과 비교한 것인지, 일정 기간 뒤 발생한 사건을 기준으로 삼은 것인지에 따라 연구가 답하는 질문이 달라집니다. 도입 후보 AI의 근거를 검토할 때는 누가 정답을 정했는가왜 그 방법을 택했는가를 함께 살펴봐야 합니다.

정답 기준 유형별로 확인할 질문

병리 또는 검사 결과를 기준으로 한 경우

병리 결과나 특정 검사 결과가 참조표준으로 쓰였다면, AI가 해당 결과와의 일치도를 평가받았다는 뜻입니다. 이때는 모든 연구 참여자에게 같은 참조표준이 적용됐는지, 양성과 음성을 나눈 기준이 무엇인지 확인하는 것이 중요합니다.

예를 들어 일부 참여자에게만 병리 검사를 시행했다면, 참조표준이 적용된 대상과 적용되지 않은 대상의 차이가 결과에 영향을 줄 수 있습니다. 연구 대상과 참조표준 적용 방식이 충분히 설명되지 않았다면, 성능 수치를 다른 환경에 그대로 옮겨 해석하기 어렵습니다.

전문가 판독 또는 전문가 합의를 기준으로 한 경우

전문의 판독이나 다수 전문가 합의를 정답으로 사용한 연구도 있습니다. 이 경우 핵심은 판독자가 몇 명이었는지 자체보다, 각 판독 결과가 어떻게 최종 정답으로 정리됐는지입니다.

불일치가 있었을 때 합의 절차가 있었는지, 양성 판정 기준이 사전에 정해졌는지, 판독자가 AI 결과를 알았는지 등을 확인해야 합니다. AI 결과를 알고 판독했다면 참조표준 형성 과정에 영향을 줄 가능성도 검토할 필요가 있습니다.

STARD는 참조표준을 다른 사람이 재현할 수 있을 정도로 설명하고, 양성 판정 기준 또는 결과 범주와 그 근거를 보고하도록 제시합니다. 또한 기준이 연구 전에 정해졌는지, 자료를 본 뒤 탐색적으로 정했는지도 구분해 밝히도록 합니다.

추적관찰 결과를 기준으로 한 경우

AI 연구에서는 한 시점의 검사 결과만 정답으로 삼지 않을 수 있습니다. 일정 기간 안에 특정 사건이 발생했는지를 참조표준으로 정의해 AI 검사와 비교하는 방식도 사용됩니다.

이때는 추적 기간이 얼마인지, 어떤 사건을 발생으로 보았는지, 추적이 끝나지 않았거나 확인되지 않은 참여자를 어떻게 처리했는지를 확인해야 합니다. 추적관찰 기반 연구의 결과는 미래 사건의 정의와 관찰 기간에 영향을 받습니다. 따라서 병리 결과를 기준으로 한 연구의 민감도·특이도와 단순 비교해서는 안 됩니다.

AI 논문에서는 ‘라벨 생성 과정’도 근거입니다

AI 진단 정확도 연구를 위한 STARD-AI는 기존 진단 정확도 보고 항목에 AI 특성을 반영한 내용을 더했습니다. 데이터 출처와 수집 방식, 데이터 주석(annotation), 장비와 소프트웨어 버전, 전처리, 훈련·검증·시험 데이터의 분할, 시험 데이터 특성 등이 포함됩니다.

여기서 데이터 주석은 AI가 학습하거나 평가받는 자료에 정답 라벨을 부여하는 과정과 연결됩니다. 예를 들어 전문가 판독을 라벨로 썼다면 판독 기준과 합의 방식이 중요하고, 추적관찰을 썼다면 사건 정의와 관찰 기간이 중요합니다.

정답 라벨이 포함된 데이터를 훈련용·검증용·시험용으로 어떻게 나누었는지도 성능 해석에 영향을 줄 수 있습니다. 같은 환자 또는 매우 유사한 자료가 훈련 데이터와 시험 데이터에 함께 포함되지 않았는지, 실제 사용 환경과 다른 데이터만으로 평가하지 않았는지도 공개 자료에서 확인할 항목입니다.

도입 검토자가 자료에서 체크할 6가지

  1. 참조표준의 종류: 병리·검사 결과, 전문가 판독, 전문가 합의, 추적관찰 중 무엇인가요?
  2. 양성·음성의 정의: 어떤 결과 범주를 양성으로 분류했으며, 근거가 제시됐나요?
  3. 판정 주체와 절차: 정답을 판정한 사람 또는 절차가 재현 가능하게 설명됐나요?
  4. 사전 결정 여부: 정답 기준과 분석 기준을 연구 전에 정했는지 확인할 수 있나요?
  5. 대상군의 유사성: 연구 참여자의 임상 환경, 인구집단, 상태의 특성이 실제 사용 환경과 비슷한가요?
  6. 비교의 공정성: 다른 제품 또는 다른 논문과 비교할 때 참조표준과 대상군이 같은가요?

STARD-AI는 민감도와 특이도가 고정된 제품 특성만은 아니라고 설명합니다. 임상 환경, 대상 인구집단, 상태의 중증도, 참조표준 정의가 달라지면 수치도 달라질 수 있습니다. 따라서 서로 다른 연구의 높은 수치를 나란히 놓고 우열을 판단하기보다, 같은 질문과 같은 정답 기준을 사용했는지부터 확인해야 합니다.

자주 묻는 질문

Q. 병리 결과를 쓴 연구라면 항상 더 신뢰할 수 있나요?

병리 결과가 사용됐다는 사실만으로 모든 연구의 적용 가능성을 단정할 수는 없습니다. 해당 참조표준이 연구 목적에 맞는지, 대상자에게 어떻게 적용됐는지, 양성 기준이 명확한지를 함께 검토해야 합니다. 참조표준 선택에는 임상적·실무적·윤리적 이유가 있을 수 있습니다.

Q. 전문가 여러 명이 합의했으면 AI가 실제 진단을 대신할 수 있나요?

전문가 합의는 연구에서 정답 라벨을 만드는 한 방법일 수 있지만, AI 결과가 의료진의 진단이나 처방을 대체한다는 뜻은 아닙니다. AI의 허가된 사용 목적, 실제 진료 흐름에서의 결과 해석 주체, 오류 발생 시 대응 절차를 별도로 확인해야 합니다. 개인의 진단과 치료 결정은 필요한 검사와 전문의 상담을 바탕으로 이뤄져야 합니다.

Q. 환자·보호자도 논문의 참조표준을 봐야 하나요?

모든 연구 방법을 직접 판단할 필요는 없지만, “무엇과 비교해 성능을 냈는가”를 의료진에게 물어보는 것은 도움이 됩니다. 특히 AI 결과가 본인의 진료 판단에 어떤 역할을 하는지, 결과가 임상적으로 어떻게 확인되는지 담당 의사 또는 전문의와 상담해 보세요.

의료 AI의 연구 성능은 진료를 위한 참고 근거 중 하나이며, 개인의 상태에 대한 자가 진단이나 치료 결정을 대신하지 않습니다. 증상, 검사 결과, AI 활용 여부의 해석은 담당 의사 또는 전문의와 상담해 결정해야 합니다.

본문에 언급된 타사 의료 AI 제품·서비스는 정보 제공 목적의 사례이며, 유유테이진의 판매·임대·상담 대상이 아닙니다. 제품·도입 문의는 해당 제조사·공식 판매처 또는 의료기관에 확인해 주세요.

문의하기

이름·연락처·문의분야만 남기시면 담당자가 빠르게 상담해 드립니다.

개인정보 수집 및 이용 동의 *