Science
LLM 3종 평가…복잡한 질문서 정확도 급락 정보 구조화·도메인 지식 결합이 관건

제약업계의 인공지능(AI) 활용을 가로막는 핵심 장벽은 모델 성능이 아니라 정보의 구조화 부족이라는 분석이 나왔다.
31일(현지시간) 미국 제약 전문 매체 피어스파마에 따르면 AI 신약개발 기업 인텔리젠시아 AI는 최신 대형언어모델(LLM) 3종을 평가한 결과 이같이 나타났다고 밝혔다.
인텔리젠시아 AI는 챗GPT-5.5, 제미나이 3.1 프로, 클로드 오푸스 4.8을 대상으로 항암제 연구개발(R&D)에서 일상적으로 수행하는 20개 질문을 던졌다.
평가 결과 세 모델 모두 단순 정보 검색이나 요약에서는 우수한 성능을 보였다. 그러나 여러 출처에 흩어진 증거를 종합해야 하는 질문에서는 정확도가 크게 떨어졌다.
구체적으로 질문 난도가 높아질수록 '진실' 점수는 급격히 하락한 반면 '신뢰' 점수는 상대적으로 안정적으로 유지됐다. 답변은 대체로 정확했지만 점점 불완전해져 과거 개발 프로그램과 근거 자료, 경쟁 구도를 누락했다.
인텔리젠시아 AI는 "제약 의사결정에서 현실을 불완전하게 재현하는 것은 잘못된 사실만큼 오해를 불러일으킬 수 있다"고 지적했다.
특히 모델들은 중단된 개발 프로그램을 놓치거나 잘못 분류했고, 활성 임상시험과 개발 중인 자산을 구분하는 데 어려움을 겪었다. 자산과 임상시험, 적응증을 여러 출처에서 대조해야 할 때는 신뢰할 수 없는 수치를 내놓기도 했다.
이런 실패는 필요한 답이 단일 출처에 명시적으로 존재하지 않는다는 공통점을 지닌다. 개발 이력이나 경쟁 구도를 재구성하려면 약물과 적응증, 임상시험, 결과 간 관계를 명시적으로 연결하고 모호성을 해소하는 전문가 규칙이 필요하다는 설명이다.
모델 세대 교체만으로는 한계를 극복하기 어렵다는 분석도 제시됐다. 약 6개월간 출시된 클로드 오푸스 4.6, 4.8, 5 버전을 비교한 결과 '진실' 점수는 세대당 평균 약 7% 개선에 그쳤고, 가장 까다로운 증거 종합 문제에서는 성능이 거의 변하지 않았다.
반면 모델에 제공하는 정보를 개선하자 효과가 더 컸다. 공공 데이터베이스에 직접 접근하도록 한 클로드 사이언스는 기본 구성 대비 평균 '진실' 점수가 41% 높아졌다. 다만 완전한 이력 재구성이나 모호한 데이터 해석이 필요한 질문에서는 개선 폭이 제한적이었다.
인텔리젠시아 AI는 "복잡한 제약 질문에서 성능은 증거가 조화롭게 정리되고 의미 있는 관계로 연결됐는지에 점점 더 좌우된다"며 "의사결정 수준의 제약 AI에는 증거를 연결하고 모호성을 해소하는 도메인 지식이라는 제3의 계층이 필요하다"고 강조했다.
이번 평가는 2026년 6월 진행됐다. 역사 데이터 8개, 경쟁 구도 7개, 임상 설계·결과 5개 등 항암제 관련 질문 20개를 모델별로 10회씩 실행해 총 600개 결과물을 생성했다. '진실'과 '신뢰'는 각각 0~8점 척도로 평가됐다.

BIOBOOK TEAM
biobookmedia@biobook.co.kr