LLM 쓰레기 컨설팅 논란 - 조이조이조이

스탠포드대 연구에 따르면 LLM이 생성한 연구 아이디어는 인간보다 신규성과 흥미도가 높지만, 실제 실행 시 평가가 크게 하락해 인간 아이디어에 못 미친다. 연구는 49명의 연구자와 79명의 심사위원을 고용해 450만엔, 실행 단계에서는 43명을 추가 고용해 2000만엔을 투입했다.

AI 요약

스탠포드대학 연구진은 LLM이 생성한 연구 아이디어의 실제 실행 가능성을 검증하기 위해 대규모 인간 평가 연구를 수행했습니다. 첫 번째 연구에서는 LLM이 생성한 연구 제안서가 인간 연구자의 제안서보다 '신규성'과 '흥미도'에서 더 높은 점수를 받았지만, 두 번째 후속 연구에서 실제로 연구를 실행한 결과 LLM 아이디어의 점수가 크게 하락하며 인간 아이디어에 뒤처지는 것으로 나타났습니다. LLM 제안에는 전문가 고용 등 현실적으로 불가능한 실행 계획이 포함되는 경우가 많아 '그럴듯하지만 실행 불가능한' 아이디어를 생성하는 문제가 확인되었습니다.

핵심 포인트

  • 49명의 연구자가 LLM과 동일한 조건에서 연구 제안서를 작성했고, 79명의 평가자가 블라인드 평가를 진행함 (총 인건비 약 450만 엔)
  • LLM 제안서는 신규성과 흥미도에서 인간을 능가했지만, 실행 가능성은 약간 낮았음
  • 후속 연구에서 43명의 연구자가 3개월간 실제 연구를 수행한 결과, LLM 아이디어의 신규성·흥미도 점수가 크게 하락 (총 인건비 약 2000만 엔)
  • LLM은 대규모 전문가 평가 등 현실적으로 불가능한 실험 설계를 제안하는 경향이 있음

향후 전망

  • LLM의 연구 아이디어 생성은 '아이디어 도출' 단계에서는 유용하지만, 실행 가능성 검증을 위한 추가적인 필터링 메커니즘이 필요할 것으로 보임
  • 인간 연구자의 경험적 판단이 여전히 연구 실행 단계에서 핵심적 역할을 할 것임
출처:hatena (joisino.hatenablog.com)
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...