Structure for Reading, Prose for Writing: Asymmetric Structural Conditioning in Multi-Agent Document Authoring
이 논문은 배포된 다중 에이전트 문서 저작 시스템을 평가하며, 입력 지침을 산문에서 구조적 마크업으로 변환하는 것이 글쓰기 품질을 현저히 저하시킨다는 결정적인 비대칭성을 밝힘으로써, 구조적 조건화는 읽기 작업을 위해 남겨두고 산문 기반 프롬프팅을 생성에 사용하는 것이 더 우수하다는 점을 시사한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
자동화된 글쓰기의 세계에는 구조가 명확성의 궁극적인 열쇠라는 지속적인 믿음이 존재한다. 컴퓨터는 문서가 단순한 평문 덩어리가 아니라 명확한 태그와 라벨로 조직되었을 때 문서를 더 정확하게 읽도록 오랫동안 학습되어 왔다. 이 원칙은 인공지능 분야의 표준 규칙이 되었다. 만약 기계가 특정 사실을 찾거나 특정 지침을 따르기를 원한다면, 정보의 구조화된 지도를 제공하는 것이 데이터 탐색을 돕는다는 것이다. 결과적으로, 많은 엔지니어들은 이와 동일한 구조적 이점이 기계가 글을 쓸 때도 적용될 것이라고 가정해 왔다. 논리는 타당해 보였다. 구조가 컴퓨터의 읽기를 돕는다면, 쓰는 데에도 도움을 줄 것이라는 논리였다.
하지만 한 새로운 연구는 매우 구체적이고 이해관계가 걸린 작업, 즉 정부 입찰 제안서에 대한 공식 답변 작성이라는 과업을 통해 이 가설에 이의를 제나든다. 입찰 제안서는 기업이 고객으로부터 수백 개의 질문에 답해야 하며, 종종 엄격한 형식 규칙을 준수하고 고객의 정확한 용어를 사용해야 하는 복잡한 문서이다. 연구진은 이 작업을 처리하기 위해 여러 인공지능 에이전트로 구성된 시스템을 구축하였으며, 요구 사항 읽기, 사실 수집, 답변 초안 작성의 과업을 분리하였다. 그들은 이 시스템을 동일한 조직이 제출한 실제 인간 작성 입찰서와 비교 테스트하였다. 그들이 발견한 것은 기계가 학습하는 방식에서의 놀라운 분열이었다. 구조는 기계를 더 나은 독자로 만들지만, 기계를 더 나쁜 작가로 만든다는 것이다. 이 연구는 AI를 안내하는 최선의 방법이 경직된 템플릿을 따르도록 강요하는 것이 아니라, 구조화된 데이터를 읽게 하되 자연어로 글을 쓰게 하고 품질 확보를 위한 자체적인 내부 점검을 적용하도록 하는 것임을 시사한다.
연구진은 먼저 이 다중 에이전트 시스템을 실제 조달 요청에 대한 답변 초안을 작성하는 데 배치했다. 이 시스템은 신중하고 정밀하게 설계되었다. 단순히 답을 추측하려 하지 않고, 대신 작업을 작은 단계로 나누었다. 먼저, 고객의 문서를 읽고 질문과 지침 사이의 관계를 보존하는 구조적 형식으로 변환했다. 그다음, 과거 문서와 기업 기록 라이브러리에서 정보를 수집했다. 마지막으로 답변 초안을 작성했다. 성능을 확인하기 위해 팀은 기계의 초안을 해당 조직이 다른 입찰을 위해 손으로 직접 작성했던 실제 입찰서와 비교했다. 이 비교에서 기계는 복사할 예시가 없었으며, 전적으로 자신의 추론과 제공된 문서에 의존해야 했다.
독립적인 판사, 즉 단순히 원본과 얼마나 유사한지가 아니라 글쓰기의 품질을 평가하도록 훈련된 또 다른 인공지능이 결과를 검토했다. 기계의 답변은 55개 섹션 중 40개 섹션에서 인간이 쓴 것만큼 혹은 그보다 더 좋은 것으로 평가받았다. 4개 섹션에서는 기계가 실제로 더 나은 성적을 거두었다. 기계는 단 하나의 섹션도 완전히 놓치지 않았다. 유일한 주요 문제는 텍너가 명시적으로 언급하지 않은 보안 기능을 기계가 추론하여 포함한, 단 하나의 근거 없는 주장뿐이었다. 이 결과는 매우 인상적이었는데, 특히 기계가 최신 모델이 아니었으며 학습할 사전 예시가 없었다는 점을 고려하면 더욱 그러했다.
그러나 연구진은 표면적인 점수에 머물지 않았다. 그들은 기계가 인간 작성자보다 성적이 낮았던 15개 섹션을 더 깊이 파고들었다. 그들은 기계가 글을 못 써서 실패한 것인지, 아니면 단순히 적절한 정보가 없어서 실패한 것인지 알고 싶었다. 조사 결과, 이러한 '실패' 사례의 거의 70%는 실제로 데이터의 부재 때문이었다. 인간 작성자는 경험이나 비공개 대화를 통해 알 수 있었던 특정 세부 사항을 알고 있었지만, 기계의 시스템에는 그러한 정보가 주어진 적이 없었다. 연구진이 누락된 사실들을 무시하도록 점수를 조정하자, 기계의 성과는 거의 90%까지 뛰어올랐다. 이는 중요한 통찰을 드러냈다. 기계와 인간 사이의 격차는 주로 글쓰기 능력 때문이 아니라 정보 접근성 때문이었다는 점이다. 기계는 유능한 작가였으나 불완전한 브리핑으로 인해 제약을 받고 있었던 것이다.
이어 연구는 구조의 역할을 테스트하기 위해 더 통제된 실험으로 전환되었다. 팀은 기계가 받은 지침을 두 가지 다른 방식으로 제시했다. 한 버전은 표준 메모처럼 일반 텍스트로 작성되었다. 다른 버전은 태그가 있는 디지털 파일과 유사한 중첩된 구조적 형식으로 변환되었다. 그들은 구조화된 버전이 읽기에서 그랬던 것처럼 기계의 이해를 도울 것이라 예상했다. 하지만 정반대의 결과가 나타났다. 지침이 구조화되었을 때, 답변의 품질이 현저히 떨어졌다. 기계는 더 적은 수의 정답을 생성했고, 지침을 자신의 글 속에 더 자주 반복했는데, 이는 혼란을 겪고 있다는 신호였다.
연구진은 구조가 기계의 주의 집중 방식을 바꾼다는 것을 깨달았다. 지침이 일반 텍스트일 때 기계는 요청의 의미에 집중했다. 반면 지침이 태그와 함께 구조화되었을 때, 기계는 태그 자체에 집중했다. 기계는 고객의 이름이나 문서 제목을 문장의 가장 중요한 부분으로 취급하기 시작했고, 이로 인해 질문에 직접 답하는 대신 "고객은 ~을 요구합니다..."와 같은 어색한 문구로 답변을 시작하게 되었다. 이는 구조가 정보를 찾는 데는 도움이 될지라도, 새로운 콘텐츠를 생성해야 할 때는 기계를 산만하게 만들 수 있음을 보여주었다.
팀은 또한 기계가 '하지 말아야 할 것'에 대한 규칙을 어떻게 처리하는지 조사했다. 그들은 단순히 기계에게 "이 단어를 사용하지 마시오"라고 말하는 것이 오히려 문제를 악화시키는 경우가 많다는 것을 발견했다. 기계는 금지된 단어에 집착하여 실수로 그 단어를 다시 포함하거나, 규칙을 어기는 방식으로 사용하곤 했다. 그러나 연구진이 기계에게 자신의 문장에 대해 스스로 테스트를 수행하도록 요청했을 때(즉, 문장이 원래 질문과 너무 유사한지 확인하고 필요하다면 다시 쓰도록 함), 오류는 사라졌다. 기계는 무엇을 피하라고 정확히 지시받지 않고도 스스로를 규제하는 법을 배웠다.
마지막으로, 연구진은 시스템이 자신의 노트(주석)를 처리하는 방식에서 미묘하지만 위험한 결함을 발견했다. 기계는 특정 지점을 나타내기 위해 문서에 작은 표시를 추가하곤 했다. 이 표시는 텍스트의 길이를 미세하게 변화시켰다. 기계는 텍스트를 고정된 크기의 덩어리(chunk)로 처리했기 때문에, 이 아주 작은 길이 변화가 덩어리의 경계를 이동시켰다. 결과적으로 기계는 의도했던 것과는 다른 단어 집합을 보게 되었고, 이는 추출되는 질문의 개수가 완전히 달라지는 결과로 이어졌다. 텍스트 내의 단 두 개의 표시 차이가 시스템이 17개의 질문을 덜 추출하게 만들었다. 이는 기계가 정보를 자르는 방식이 너무 경직되어 있었기 때문에, 아주 작고 무작위적인 변화조차도 큰 오류로 번질 수 있음을 보여주었다.
전체적인 그림은 세심한 균형에 관한 것이다. 이 연구는 인공지능가 공식 문서를 작성하는 문제를 해결했다고 주장하거나, 기계가 인간 작가를 완전히 대체할 준비가 되었다고 제안하는 것이 아니다. 대신, 기술이 작동하는 곳과 어려움을 겪는 곳을 정확하게 그려낸 지도 역할을 한다. 기계는 정보를 읽고 조직하는 데 강력한 도구이며, 특히 그 정보가 구조화되어 있을 때 그러하다. 하지만 글을 쓸 때 기계를 경직된 구조 안에 가두는 것은 혼란을 줄 수 있다. 가장 효과적인 접근법은 기계가 구조화된 데이터를 읽게 하되, 자연어로 글을 쓰게 하고, 궤도에서 벗어나지 않도록 자가 점검을 활용하게 하는 것이다. 이러한 읽기와 쓰기의 구분은 단순한 기술적 세부 사항이 아니라, 중요한 업무를 신뢰할 수 있는 시스템을 구축하기 위한 근본적인 규칙이다. 연구진은 최선의 결과가 기계에게 완벽한 템플릿을 따르게 하는 것이 아니라, 올바른 정보를 제공하고 최종 초안에 자신의 판단을 적용하게 하는 데서 온다는 것을 발견했다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.