← 최신 논문
🤖 machine learning

Frustratingly Simple Black-Box Adaptation of Language Models via Logit Bias

이 논문은 모델 가중치를 수정하거나 그래디언트 접근을 요구하지 않고도 추론 작업에 대한 언어 모델의 성능을 향상시키기 위해, KL 정규화된 강화 학습 목적 함수를 통해 단일 문맥 독립적 로짓 바이어스 벡터를 학습하는 경량 블랙박스 적응 방법을 소개한다.

원저자: Ofek I. Cohen, Lior Shani, Aviv Rosenberg, Ankur Samanta, Tal Wagner, Yonathan Efroni

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ofek I. Cohen, Lior Shani, Aviv Rosenberg, Ankur Samanta, Tal Wagner, Yonathan Efroni

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 거의 모든 요리를 주문대로 만들어낼 수 있는 천재적이고 전지전능한 로봇 요리사가 있다고 상상해 보세요. 이 로봇은 너무 똑똑해서 인터넷 전체를 학습했지만, 동시에 약간의 까칠한 성격(diva)도 있어서 당신이 레시피를 바꾸기 위해 주방에 들어오는 것을 허용하지 않으며, 심지어 비밀 향신료 병을 훔쳐보는 것조차 허용하지 않습니다. 당신은 오직 주문만 할 수 있고, 그러면 로봇은 요리를 시작합니다. 때때로 로봇은 너무 수다스러워서 레시피 앞에 불필요한 이야기를 덧붙이기도 합니다. 또 어떤 때는 소금을 넣는 것을 잊어버리거나, 소스를 만드는 대신 토마토의 역사에 대해 이야기하며 혼란에 빠지기도 합니다.

인공지능의 세계에서 이 로봇은 "대규모 언어 모델(LLM)"입니다. "주방"은 모델의 내부 두뇌이며, "레시 recipe"는 문장의 다음 단어를 예측하는 데 사용하는 수학적 방식입니다. 보통 로봇에게 수학 문제를 풀거나 짧은 이메일을 쓰는 것과 같이 특정한 작업을 더 잘하게 만들려면, 모델을 다시 훈련시키기 위해 공장으로 보내야 합니다. 하지만 만약 그럴 수 없다면 어떻게 될까요? 만약 로봇이 블랙박스 안에 갇혀 있고, 당신에게는 단 하나의 아주 작은 조절 노브(control knob)만 있다면 어떨까요? 이 논문은 단순하면서도 약간은 발칙한 질문을 던집니다: 로봇의 두뇌를 전혀 건드리지 않고도, 그 하나의 노브를 조절하여 로봇을 더 똑똑하게 만들 수 있을까?

텔아비브 대학교와 구글의 연구진은 바로 그 일을 시도해 보기로 했습니다. 그들은 "로짓 바이어스(logit bias)"라는 기능에 집중했습니다. 로봇의 두뇌를 다음에 말할 수 있는 모든 가능한 단어들의 거대한 메뉴판이라고 생각해 보세요. 로봇이 단어를 선택하기 전에, 그는 메뉴의 각 항목에 "점수"를 부여합니다. "로짓 바이어스"는 로봇이 선택을 내리기 전에 어떤 단어에는 점수를 몇 점 더해주고, 다른 단어에서는 점수를 빼는 방법입니다. 이것은 마치 로봇에게 "헤이, 나는 '답변'이라는 단어를 정말 좋아하고, '음'이라는 단어는 정말 싫어해"라고 속삭이는 것과 같습니다.

연구팀의 핵심 아이디어는 '완벽한 속삭임'을 찾는 것이었습니다. 그들은 로봇이 받는 모든 질문에 대해 작동할 수 있는 단 하나의 고정된 점수 조정 목록을 찾고 싶었습니다. 그들은 로봇의 두로를 바꾸고 싶은 것이 아니라, 단지 로봇의 선택을 살짝 유도하고 싶었을 뿐입니다. 이를 위해 그들은 영리한 트릭을 사용했습니다. 로봇이 여러 번 요리를 하게 하고, 그 요리가 좋은지 확인한 후(보상 시스템을 사용하여), 어떤 단어에 "보너스"를 주어야 요리가 더 좋아졌을지를 계산했습니다. 그들은 "역 확률 가중치(inverse propensity scoring)"라는 통계적 방법을 사용하여 이를 계산했는데, 이는 기본적으로 "만약 로봇이 우연히 특정 단어를 골랐다면, 우리가 그것을 의도적으로 고르도록 얼마나 원했을까?"를 알아내는 방식입니다.

결과는 놀라울 정도로 효과적이었지만, 몇 가지 한계도 있었습니다. 연구진이 학습된 "속삭임"을 수학 및 추론 테스트에 적용했을-때, 로봇은 문제 해결 능력이 약간 향상되었습니다. 예를 들어, MATH라는 까다로운 수학 벤치마크에서 로봇의 정확도는 약 30.3%에서 33.1%로 올라갔습니다. 엄청난 도약은 아니지만, 로봇의 두뇌 속 가중치를 단 하나도 바꾸지 않고 달성한 실제적인 개선입니다. 더욱 흥미롭게도, 그들은 이 방법을 사용하여 로봇을 더 짧고 간결하게 만들었습니다. 바이어스를 조절함으로써, 그들은 로로봇이 정답을 놓치지 않으면서도 말을 더 빨리 끝내도록 설득할 수 있었고, 일부 모델의 답변 길이를 900단어 이상에서 900단어 미만으로 줄였습니다.

하지만 이 논문은 이 방법이 할 수 없는 일에 대해서도 매우 명확하게 밝히고 있습니다. 연구진은 이 "속삭임"이 포맷팅을 맞추거나, 로봇의 횡설수설을 막거나, 올바른 답변 스타일로 유도하는 데는 훌륭하지만, 로봇에게 새로운 논리를 가르칠 수는 없다는 것을 발견했습니다. 만약 로봇이 특정 수학 문제를 푸는 법을 모른다면, 바이어스를 추가한다고 해서 갑자기 수학 실력이 생기지는 않습니다. 그것은 마치 선수에게 "더 빨리 달려"라거나 "몸을 가만히 있어"라고 말할 수는 있지만, 선수가 게임의 규칙을 모른다면 게임을 하는 법 자체를 가르칠 수는 없는 코치와 같습니다. 논문은 이 방법이 가볍고 "블랙박스"적인 도구임을 시사합니다. 즉, 모델을 재학습시킬 수 없을 때 사용하기에는 완벽하지만, 깊고 복잡한 추론이 필요할 때 전체 훈련을 대체할 수는 없다는 것입니다.

결국, 저자들은 단순하고 맥락에 의존하지 않는 유도(nudge)가 고정된 모델로부터 조금 더 많은 성능을 끌어낼 수 있음을 보여줍니다. 이는 때때로 더 많은 속도를 얻기 위해 엔진을 새로 만들 필요 없이, 단지 어떤 버튼을 눌러야 하는지만 알면 된다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →