← 최신 논문
🤖 AI

AI-based worker guidance in assembly and disassembly operations using multimodal ego/exo-centric data capture and structured task knowledge

본 논문은 전문가의 시연으로부터 구조화된 작업 지식을 추출하기 위해 멀티모달 1인칭 및 3인칭 비디오와 내레이션을 활용하는 데이터 중심적 접근 방식을 제시하며, 이를 통해 조립 및 분해 작업에 대한 효과적인 절차적 문서화와 문맥 인지형 가이드를 가능하게 한다.

원저자: Vivek Chavan, Jörg Krüger

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vivek Chavan, Jörg Krüger

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

공장의 고요한 소음 속에서, 숙련된 기술자가 복잡한 기계를 다루고 있습니다. 그들은 어떤 나사를 먼저 풀어야 하는지, 엉킨 케이블을 손상시키지 않고 어떻게 경로를 잡아야 하는지, 그리고 부품이 없거나 마모되었을 때 어떻게 해야 하는지를 정확히 알고 있습니다. 이 지식은 수년간의 연습을 통해 그들의 손과 머릿속에 축적된 것입니다. 수십 년 동안 엔지니어들은 로봇에게 이 작업을 가르치기 위해 노력해 왔지만, 기계는 물건을 분해하는 복잡하고 예측 불가능한 현실 앞에서 어려움을 겪습니다. 모든 부품이 완벽한 계획에 따라 들어맞는 제품을 처음부터 만드는 것과 달리, 오래된 장치를 분해하는 일은 녹슨 부분, 부러진 클립, 시간이 흐르며 위치가 변한 부품들을 다루는 일을 수반합니다. 정해진 규칙에 따른 경직된 사전 프로그래밍 동작에 의존하는 전통적인 자동화는 세상이 그 각본대로 흘러가지 않을 때 종종 실패합니다. 이를 해결하기 위해 연구자들은 다른 종류의 지능, 즉 인간 전문가를 관찰하고 그들의 목소리를 들으며 단순히 무엇을 하는지뿐만 아니라 왜 그렇게 하는지까지 포착할 수 있는 시스템으로 눈을 돌리고 있습니다.

프라운호퍼 연구소와 베를린 공과대학교의 연구팀은 이러한 전문가의 지식을 포착하여 작업자를 위한 가이드로 전환하는 새로운 방법을 개발했습니다. 이들의 접근 방식은 오래된 컴퓨터와 같은 폐전기전자제품(WEEE)을 해체하는 까다로운 작업에 초점을 맞춥니다. 로봇이 스스로 모든 단계를 파악하도록 강요하는 대신, 이 시스템은 전문가가 스마트 글래스를 착용하고 자신의 생각을 소리 내어 말하며 작업을 수행하는 과정을 기록합니다. 이 설정은 두 개의 카메라를 사용합니다. 하나는 전문가가 보는 것을 똑같이 볼 수 있도록 안경에 장착된 카메라이고, 다른 하나는 작업 공간 전체를 보여주는 실내 고정 카메라입니다. 전문가는 작업하면서 자신의 행동을 설명하고, 추론 과정을 밝히며, 잠재적인 실수에 대해 지적합니다. 이는 눈으로 보는 것과 목소리로 설명하는 것을 결과물로 결합하여 풍부한 기록을 만들어냅니다.

연구진은 그다음 첨단 컴퓨터 프로그램을 사용하여 이 기록을 구조화된 작업 지도로 변환합니다. 먼저, 시스템은 음성을 텍스트로 전사하며 모든 문장을 해당 문장이 말해진 정확한 순간과 연결합니다. 강력한 언어 모델은 이 전사본을 읽어 작업의 논리를 이해합니다. 모델은 어떤 단계가 다른 단계보다 먼저 일어나야 하는지, 어떤 단계들이 어떤 순서로든 수행될 수 있는지, 그리고 어떤 부품들이 독립적인지를 파악합니다. 그 결과물은 시각적인 순서도, 즉 선행 그래프(precedence graph)로, 이는 작업의 올바른 순서를 보여줍니다. 이 지도는 단순한 지침 목록이 아닙니다. 그것은 단계 간의 관계를 이해합니다. 예를 들어, 특정 나사에 접근하기 전에 커버를 먼저 제거해야 한다는 점은 알지만, 두 가지 서로 다른 내부 부품은 어떤 순서로든 꺼낼 수 있다는 점을 이해합니다.

이 지도가 생성되고 인간에 의해 정확성이 검증되면, 시스템은 영상 속의 동작을 인식하는 법을 배웁니다. 시스템은 기록을 작은 클립들로 나누고, 각 클립에 수행 중인 특정 단계를 라벨링합니다. 이를 통해 컴퓨터는 손이 도구를 어떻게 잡는지, 혹은 부품을 어떻게 끌어당기는지와 같은 작업의 시각적 세부 사항을 이해할 수 있습니다. 이제 시스템은 실시간으로 작업자를 도울 준비가 되었습니다. 작업자가 작업을 수행함에 따라 시스템은 영상 피드를 관찰하고, 작업자가 무엇을 하고 있는지 인식하며, 지도와 대조하여 진행 상황을 확인합니다. 작업자가 올바른 경로를 따르고 있다면 시스템은 조용히 유지됩니다. 만약 작업자가 주춤하거나 실수를 한다면, 시스템은 다음으로 유효한 단계를 제안하거나 전문가가 해당 동작을 정확하게 수행하는 짧은 영상 클립을 보여줄 수 있습니다.

연구팀은 상호작용하는 많은 부품과 도구가 포함된 작업인 워크스테이션 컴퓨터 해체 작업에 이 방법을 테스트했습니다. 그들은 단 한 번의 전문가 시연만으로도 작업의 논리적 구조를 성공적으로 추출할 수 있음을 발견했습니다. 네 명의 서로 다른 전문가로부터 얻은 기록을 사용했을 때, 시스템은 더욱 신뢰도가 높아졌으며 동작을 인식하고 올바른 다음 단계를 제안하는 능력이 향상되었습니다. 테스트 결과, 시스템은 단계의 순서와 그들 사이의 의존 관계를 높은 정확도로 식별해 냈습니다. 또한 현재 상황에 적합한 조언을 제공하며 작업자를 안내할 수 있었습니다. 결과는 단 하나의 사례만으로도 시스템이 유용한 가이드를 만들 수 있으며, 더 많은 사례를 추가하면 서로 다른 사람들이 작업을 수행하는 방식의 차이를 처리할 수 있을 만큼 견고해진다는 것을 보여주었습니다.

이 연구는 수리, 재활용 또는 복잡한 제품을 분해해야 하는 산업 분야에 나아갈 길을 제시합니다. 숙련된 노동자의 암묵적 지식을 포착하여 디지털 가이드로 전환함으로써, 공장은 모든 로봇의 움직임을 일일이 프로그래밍하지 않고도 경험이 적은 작업자를 지원할 수 있습니다. 이 시스템은 인간을 대체하는 것이 아니라, 관찰하고 이해하며 필요할 때 도움을 주는 지식 있는 파트너 역할을 합니다. 연구자들은 이 접근 방식이 로봇이 이러한 작업을 스스로 학습하도록 돕는 데 확장될 수 있다고 믿으며, 이를 통해 기계가 인간의 시연을 바탕으로 긴 일련의 동작을 계획할 수 있게 될 것이라고 보고 있습니다. 현재로서는 현대 제조의 복잡성을 헤쳐 나가는 인간 작업자를 돕는 데 초점을 맞추고 있으며, 이를 통해 귀중한 기술이 소실되지 않고 미래를 위해 공유되고 보존되도록 하는 데 목적을 두고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →