← 최신 논문
🤖 machine learning

Clarify Before You Draw: Proactive Agents for Robust Text-to-CAD Generation

이 논문은 코드 합성 전 타겟팅된 명확화 과정을 통해 모호하거나 일관되지 않은 텍스트 프롬프트를 해결하는 선제적 에이전트 프레ك워크인 ProCAD를 소개하며, 이는 견고하고 유효한 CadQuery 프로그램을 생성하는 데 있어 기존 모델들을 크게 능가한다.

원저자: Bo Yuan, Zelin Zhao, Petr Molodyk, Bin Hu, Yongxin Chen

게시일 2026-06-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bo Yuan, Zelin Zhao, Petr Molodyk, Bin Hu, Yongxin Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 건축가로서 맞춤형 가구를 만들고 싶어 한다고 상상해 보세요. 하지만 직접 설계도를 그리는 대신, 매우 똑똑하지만 다소 문자 그대로만 받아들이는 로봇 제작자에게 말로 설명하기만 하는 상황입니다.

문제점: 제작 과정의 "추측 게임"
과거에는 만약 당신이 로봇에게 "원형 상판과 다리 네 개가 있는 테이블을 만들어줘"라고 말했다면, 로봇은 즉시 제작에 착수했을 것입니다. 하지만 문제는 당신이 테이블의 크기가 얼마인지, 다리의 두께는 어느 정도인지, 혹은 상판이 나무인지 금속인지 말하지 않았다는 점입니다.

로봇은 사용자를 기쁘게 하고 싶어 안달이 나 있었기 때문에, 누락된 세부 사항들을 추측해서 채워 넣었습니다. 때로는 추측이 맞기도 했지만, 대개는 흔들거리거나 너무 작거나, 혹은 제작이 불가능한 테이블을 만들어냈습니다. 만약 지시 사항이 약간이라도 모순되었다면(예: "완벽하게 둥글면서 동시에 정사각형인 상판"), 로봇은 혼란에 빠져 시스템이 충돌하거나 무너져 내리는 물건을 만들고 말았습니다.

해결책: "명확화 에이전트" (ProCAD)
이 논문의 저자인 Bo Yuan과 그의 팀은, 이 문제를 해결하는 최선의 방법이 로봇을 더 똑똑하게 추측하도록 만드는 것이 아니라, 먼저 질문을 던지게 만드는 것임을 깨달았습니다.

그들은 ProCAD라고 불리는 시스템을 구축했는데, 이는 마치 두 명의 건설 팀이 협업하는 것처럼 작동합니다:

  1. 탐정 (명확화 에이전트 - Clarifying Agent): 로봇이 제작을 시작하기 전, 이 에이전트는 세심한 프로젝트 매니저 역할을 수행합니다. 이 에이전트는 당신의 요청을 읽고 이렇게 말합니다. "잠깐만요. '원형 상판'이라고 말씀하셨는데, 크기는 말씀하지 않으셨어요. 2피트인가요, 아니면 20피트인가요? 또한, '정사각형'이면서 동시에 '원형'이라고 하셨는데, 둘 중 무엇을 의미하시나요?"

    • 이 에이전트는 정말 필요할 때만 질문을 던지므로, 수많은 질문으로 당신을 번거롭게 하지 않습니다.
    • 이 에이전트는 당신의 답변을 기다렸다가 완벽하고 완전한 설계도를 만들어냅니다.
  2. 제작자 (코딩 에이전트 - Coding Agent): 탐정이 명확하고 모순 없는 설계도를 완성하면, 이를 제작자에게 전달합니다. 이 에이전트는 전문 기술자로서, 그 명확한 지시 사항을 실제 3D 모델을 구축하는 컴퓨터 코드(Cadiment/CadQuery)로 변환하는 방법을 정확히 알고 있습니다.

이 팀을 교육시킨 방법
연구진은 단순히 무작위적인 지시를 주어 이 팀을 가르치지 않았습니다. 그들은 특별한 훈련 라이브러리를 만들었습니다:

  • 제작자를 위해: 그들은 지시 사항이 명확하고 결과물인 3D 모델이 결점 없는 완벽한 사례 1,600개를 사용했습니다. 이를 통해 제작자는 좋은 지시 사항이 주어졌을 때 어떻게 완벽한 코드를 작성하는지 배웠습니다.
  • 탐정을 위해: 그들은 "시뮬레이션 게임"을 만들었습니다. 완벽한 지시 사항을 가져온 뒤, 의도적으로 정보를 누락시키거나(크기 생략) 모순을 추가하여(모순된 형태) "망가진" 요청들을 만들어냈습니다. 그런 다음 탐정이 이러한 오류를 포착하고, 대화를 짧고 간결하게 유지하면서도 올바른 질문을 던져 문제를 해결하는 법을 가르쳤습니다.

결과: 이것이 중요한 이유
그들이 ProCAD를 다른 최고 수준의 AI 모델들(Claude Sonnet 4.5와 같은 매우 비싼 폐쇄형 모델 포함)과 테스트했을 때, 결과는 인상적이었습니다:

  • 오류 감소: "무효율 비율(Invalidity Ratio, 로봇이 충돌하거나 쓰레기를 만드는 빈도)"이 거의 5%에서 1% 미만으로 떨어졌습니다.
  • 정확도 향 향상: 최종 3D 모델은 사용자가 실제로 원했던 것과 훨씬 더 일치했습니다. "Chamfer 거리(형태가 목표물에 얼마나 가까운지를 측정하는 수학적 방식)"는 거의 80% 개선되었습니다.
  • 좌절감 감소: 시스템은 다른 모델들보다 질문을 덜 던졌으며 더 빠르게 작업을 완료했습니다.

요약하자면
AI에게 당신의 마음을 추측하고 운 좋게 맞추기를 강요하는 대신, ProCAD는 작업을 시작하기 전에 세부 사항을 재차 확인하는 유능한 인간 조수처럼 행동합니다. "그리기 전에 명확히 함으로써", 이 시스템은 실패한 모델을 만드는 시행착오 없이 당신이 상상한 그대로의 최종 3D 디자인을 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →