Designing large language model prompts to extract scores from messy text: A shared dataset and challenge
이 논문은 영국 품질 점수가 포함된 1,446개의 지저분한 연구 텍스트로 구성된 공유 데이터셋과, 유효한 점수를 정확하게 추출하거나 누락된 값을 식별하는 최적의 거대 언어 모델 프롬프트를 설계하기 위한 과제를 소개하며, 이는 초기 72.6%의 정확도 기준점을 넘어서는 것을 목표로 함과 동시에 복잡한 수치 작업에 대한 프롬프트 엔지니어링의 이해를 증진하는 것을 목적으로 한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대한 편지 더미를 정리하려는 사서라고 상상해 보세요. 각 편지는 연구 논문이 얼마나 좋은지를 설명하기 위해 서로 다른 로봇(AI)이 작성한 것입니다. 로봇들은 1점에서 4점 사이의 별점 점수와 같이 단순한 등급을 매기도록 되어 있었습니다.
하지만 로봇들은 글씨를 엉망으로 쓰는 편입니다. 어떤 편지는 점수로 시작하고, 어떤 편지는 문단 중간에 점수를 숨겨두며, 어떤 편지는 세 가지 서로 다른 점수를 주고 그것들을 합치는 것을 잊어버리기도 합니다. 게 wh면, 어떤 편지는 점수를 주지도 않고 그저 횡설수설하기도 합니다. 설상가상으로, 어떤 로봇들은 규칙에서 허용하는 1~4점 대신 "95%"나 "4/5"와 같은 가짜 점수를 만들어내기도 합니다.
문제 상황
마이크 텔월(Mike Thelwall)이라는 저자는 이 엉망인 편지 1,446개를 모았습니다. 그는 이것을 "공유 데이터셋"이라고 부릅니다. 그의 목표는 다른 연구자들에게 더 똑똑한 로봇을 위한 "마법의 지침서"(프롬프트라고 불리는 것)를 만들라는 과제를 주는 것입니다.
이 새로운 로봇의 임무는 이 엉망인 편지들을 읽고 올바른 숫자를 뽑아내는 것입니다. 하지만 이 로봇은 두 가지 엄격한 규칙을 따라야 합니다:
- 탐정이 될 것: 편지가 혼란스럽더라도 로봇은 올바른 점수를 찾아내야 합니다. 만약 편지에 "독창성(Originality)", "유의성(Significance)", "엄밀성(Rigour)"이 각각 언급되어 있다면, 로봇은 그것들을 평균 내야 한다는 것을 알아야 합니다. 만약 편지에 점수가 없다면, 반드시 "-1"(모르겠다는 뜻)이라고 말해야 합니다.
- 수다쟁이가 아닌 로봇이 될 것: 로봇은 오직 숫자(예: "3*" 또는 "-1")만을 내뱉어야 합니다. "제 생각에 점수는 ~인 것 같습니다 because..."와 같이 말해서는 안 됩니다. 만약 단 한 마디라도 추가적인 말을 덧붙인다면, 그 답은 틀린 것입니다.
도전 과제
이것은 매우 문자 그대로 받아들이지만 약간 혼란스러워하는 로봇과 함께 하는 "사이먼 세즈(Simon Says)" 게임과 같습니다.
- 현재 점수: 저자는 간단한 지침서를 시도해 보았고, 로봇은 약 **73%**의 확률로 정답을 맞혔습니다.
- 목표: 도전 과제는 더 높은 점수를 얻을 수 있는 더 나은 지침서를 설계하는 것입니다.
이것을 왜 하는가?
이 논문은 지금 당장 이 기술을 실제 학생들의 에세이를 채점하거나 의료 진단을 수정하는 데 사용하기 위한 것이 아닙니다. 대신, 이것은 훈련 과정입니다. 연구자들이 엉망인 텍스트에서 어떻게 특정 숫자를 추출하도록 로봇에게 명령하는지 파악하게 함으로써, 우리는 다음을 배웁니다:
- 로봇이 더 잘 듣도록 대화하는 법 (프롬프트 디자인).
- 로봇이 어디에서 혼란을 느끼는지, 그리고 그 지침을 어떻게 수정할 것인지.
- 로봇이 확신이 없는 상황을 어떻게 다룰 것인지 (추측하는 대신 "-1"이라고 말하는 법을 아는 것).
결론
이 논문은 하나의 콘테스트에 대한 초대장입니다. 이 논문은 이렇게 말합니다. "여기 엉망인 로봇의 메모들과 정답 목록이 있습니다. 당신은 로봇이 이 메모들을 읽고 매번 정확히 맞는 숫자만을 내놓도록 만드는 완벽한 지침 세트를 작성할 수 있습니까?" 승자는 가장 높은 정답률을 기록하는 사람입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.