AI 요약
스탠포드대학 연구진은 LLM이 생성한 연구 아이디어의 실제 실행 가능성을 검증하기 위해 대규모 인간 평가 연구를 수행했습니다. 첫 번째 연구에서는 LLM이 생성한 연구 제안서가 인간 연구자의 제안서보다 '신규성'과 '흥미도'에서 더 높은 점수를 받았지만, 두 번째 후속 연구에서 실제로 연구를 실행한 결과 LLM 아이디어의 점수가 크게 하락하며 인간 아이디어에 뒤처지는 것으로 나타났습니다. LLM 제안에는 전문가 고용 등 현실적으로 불가능한 실행 계획이 포함되는 경우가 많아 '그럴듯하지만 실행 불가능한' 아이디어를 생성하는 문제가 확인되었습니다.
핵심 포인트
- 49명의 연구자가 LLM과 동일한 조건에서 연구 제안서를 작성했고, 79명의 평가자가 블라인드 평가를 진행함 (총 인건비 약 450만 엔)
- LLM 제안서는 신규성과 흥미도에서 인간을 능가했지만, 실행 가능성은 약간 낮았음
- 후속 연구에서 43명의 연구자가 3개월간 실제 연구를 수행한 결과, LLM 아이디어의 신규성·흥미도 점수가 크게 하락 (총 인건비 약 2000만 엔)
- LLM은 대규모 전문가 평가 등 현실적으로 불가능한 실험 설계를 제안하는 경향이 있음
향후 전망
- LLM의 연구 아이디어 생성은 '아이디어 도출' 단계에서는 유용하지만, 실행 가능성 검증을 위한 추가적인 필터링 메커니즘이 필요할 것으로 보임
- 인간 연구자의 경험적 판단이 여전히 연구 실행 단계에서 핵심적 역할을 할 것임
출처:hatena (joisino.hatenablog.com)
