How much technical talent is there? A systematic estimate of the ML research pool among 3 million consultants
이 논문은 ML 컨설팅 기업 403 개를 대상으로 한 체계적 분석을 통해 전 세계적으로 수천 명 규모의 고도 기술적 ML 연구 인력이 존재하며, 이는 MATS 프로그램 졸업생의 두 배에 달하지만 2025 년 말 기준 현재 어떤 AI 모델도 해당 인력을 대체할 수 있는 수준의 실용적 작업 시험을 통과하지 못했음을 보여줍니다.
원저자:Maximilian Schons, Red Bermejo, Florian Aldehoff-Zeidler, Niccolò Zanichelli, Oliver Evans, Gavin Leech, Samuel Härgestam
우리는 보통 AI 연구라고 하면 구글, 오픈AI 같은 거대 기업이나 대학의 연구실만 생각합니다. 하지만 이 연구팀은 **"아마도 우리가 모르고 있는 곳에, AI 안전을 지킬 수 있는 숨겨진 천재들이 IT 컨설팅 회사에 숨어 있을지도 모른다"**고 생각했습니다.
마치 **거대한 숲 (전 세계 IT 컨설팅 회사) 속에 숨겨진 보물 (고급 AI 연구 인재)**을 찾는 탐험과 같습니다.
🔍 2. 탐사 방법: "디지털 망원경"과 "현실 시험"
연구팀은 두 가지 강력한 무기를 들고 나섰습니다.
디지털 망원경 (데이터 분석):
전 세계 2,100 개 이상의 IT 컨설팅 회사를 찾아냈습니다. (약 326 만 명의 직원)
이 회사들의 직원들이 쓴 **이력서 (LinkedIn)**를 거대한 AI(대형 언어 모델) 와 정교한 필터로 훑어봤습니다. 마치 수백만 개의 이력서를 순식간에 읽어서 "이 사람은 진짜 AI 연구자일까?"를 판단하는 것입니다.
그 결과, 약 1,100 명의 '진짜' AI 연구 인재가 숨어있을 것으로 추정했습니다. (95% 신뢰구간: 252 명~3,165 명)
현실 시험 (워크 트라이얼):
이론만으로는 부족하죠. 연구팀은 97 개 회사에 연락해서 **"실제로 어려운 AI 안전 과제를 해결해 보세요"**라고 요청했습니다.
마치 요리 대회처럼, 참가자들에게 "새로운 레시피 (알고리즘) 를 만들어서 요리를 해보세요"라고 시켰습니다.
결과: 8 개 팀이 참여했고, 그중 **6 개 팀 (75%)**이 "이 일을 할 수 있다"는 평가를 받았습니다.
재미있는 반전: 최신 AI 로봇 (AI 에이전트) 들도 이 시험을 통과하지 못했습니다. 즉, 현재의 AI 로봇보다 인간 전문가들이 훨씬 더 똑똑하게 복잡한 문제를 해결할 수 있다는 뜻입니다.
📊 3. 발견한 보물 지도 (결과)
보물의 양: 전 세계 IT 컨설팅 회사에는 수천 명의 고급 AI 연구 인재가 잠자고 있습니다.
보물의 분포:
대부분의 회사는 작지만 (100 명 미만), 작은 회사들에도 재능 있는 인재들이 숨어 있습니다.
거대 기업 (1 만 명 이상) 은 전체 인원의 비율로 보면 AI 연구자가 적지만, 절대적인 숫자는 꽤 많습니다.
지역: 미국과 유럽에 가장 많이 몰려 있지만, 전 세계적으로 퍼져 있습니다.
💡 4. 이 연구가 우리에게 주는 메시지
이 연구는 **"AI 안전을 위해 더 많은 사람이 필요하다는데, 그 사람들은 어디에 있을까?"**에 대한 답을 줍니다.
숨겨진 자원: 우리는 이미 AI 안전을 지킬 수 있는 많은 전문가를 가지고 있습니다. 다만, 그들이 거대 연구실이 아니라 IT 컨설팅 회사에 있다는 것을 몰랐을 뿐입니다.
활용 방법: 이들을 모으기 위해서는 단순히 "일해 주세요"라고 하는 게 아니라, 구체적인 과제와 명확한 방향성을 제시해야 합니다. 마치 명예로운 사령관이 용감한 병사들에게 미션을 부여하듯이요.
AI 로봇의 한계: 아무리 똑똑한 AI 로봇이 발전해도, 아직은 복잡한 문제를 해결하는 인간 전문가의 능력을 완전히 대체할 수는 없습니다.
🎯 결론
이 연구는 **"AI 안전을 위한 인재는 이미 우리 곁에 있습니다. 다만, 그들이 숨어있는 'IT 컨설팅'이라는 숲을 제대로 찾아내고, 그들에게 올바른 미션을 주면, 우리는 AI 위험을 막을 수 있는 거대한 힘을 키울 수 있다"**고 말합니다.
마치 잠자고 있던 영웅들을 깨워, 새로운 세상을 지키는 군단을 만드는 것과 같습니다.
1. 연구 배경 및 문제 정의 (Problem)
핵심 문제: AI 안전 (Safety) 및 정렬 (Alignment) 연구의 주요 병목 현상은 기술적 인재 부족입니다. 현재 소수의 최첨단 연구소 (Frontier Labs) 와 학술 그룹을 제외하고는, 생산 속도로 복잡한 정렬 및 평가 작업을 수행할 수 있는 조직이 거의 없습니다.
연구 목적: IT 컨설팅 산업 내에 잠재된 '잠재적 (Latent)' ML 연구 인력 풀을 식별하여, 이를 AI 위험 완화 및 정렬 연구 과제로 동원할 수 있는지 확인하는 것입니다.
가설: 대규모 IT 컨설팅 기업 (Accenture, Capgemini 등) 은 수백만 명의 직원을 보유하고 있으며, 이 중 상당수가 기술적으로 유능한 ML 연구 인력일 가능성이 있다.
2. 연구 방법론 (Methodology)
연구는 2025 년 6 월부터 8 월까지 진행되었으며, 다음과 같은 체계적인 파이프라인을 사용했습니다.
A. 데이터 수집 및 필터링
대상: 전 세계 2,121 개 조직을 스크리닝하여 최종적으로 403 개의 ML 관련 컨설팅 서비스를 제공하는 기업을 선정했습니다.
규모: 총 326 만 9 천 명의 직원 데이터 (LinkedIn Sales Navigator 및 BrightData 를 통해 수집) 를 분석 대상으로 삼았습니다.
지리적 분포: 주로 미국과 유럽에 집중되어 있으나, 전 세계적으로 분포되어 있습니다.
B. 인력 추정 모델 (Estimation Pipeline)
개별 직원의 LinkedIn 프로필 (이력서) 을 분석하여 '기술적 ML 연구 인재 (Technical ML Research Talent)'를 식별하기 위해 6 가지 어노테이터 (Annotator) 를 결합한 부트스트랩 프로빗 모델 (Bootstrap Probit Model) 을 구축했습니다.
키워드 필터링 (3 가지): 광범위 (Broad), 엄격 (Strict), 그리고 결합된 키워드 필터를 사용하여 ML 관련 용어 (예: transformer, loss calculation, distributed training 등) 를 검색했습니다.
LLM 분류기 (3 가지): Google Gemini 2.5 Flash, OpenAI GPT-5 Mini, Anthropic Claude Sonnet 4 를 사용하여 이력서 내용을 분석하고 ML 연구 역량을 평가했습니다.
통계적 모델: Dawid-Skene 모델을 기반으로 하되, 어노테이터 간의 오류 상관관계를 모델링하는 다변량 프로빗 (Multivariate Probit) 모델을 사용하여 각 직원이 ML 전문가일 확률을 추정했습니다.
성능: 최종 모델의 정밀도 (Accuracy) 는 0.89, 민감도 (Sensitivity) 는 0.79, 특이도 (Specificity) 는 0.926을 기록했습니다.
C. 검증 (Validation)
작업 시험 (Work Trial): 선정된 8 개 컨설팅 기업에 'Sequential Unlearning' (기존 RMU 알고리즘을 기반으로 데이터를 점진적으로 잊게 하는 방법) 구현 과제를 부여했습니다.
벤치마크: 동일한 과제를 최신 AI 에이전트 (GPT-5, Claude Opus 4.1) 가 수행하도록 하여 인간 전문가와의 능력을 비교했습니다.
3. 주요 결과 (Key Results)
A. 인력 풀 규모 추정
총 추정치: 403 개 컨설팅 기업 내 고도로 기술적인 ML 연구 인재는 약 1,121 명 (80% 신뢰구간: 252 ~ 3,165 명) 으로 추정되었습니다.
분포:
Probable (유력): 80% 신뢰구간이 0 을 포함하지 않는 81 개 기업 (전체 ML 인력의 79.4% 를 차지).
Small/Medium/Large: 소규모 기업 (<100 명) 이 전체 기업의 70.5% 를 차지했으나, ML 인력 밀도는 기업 규모와 지역에 따라 이질적임.
밀도: 전체 컨설팅 인력 대비 ML 연구 인력 비율은 평균 0.01% 수준으로 낮았으나, 개별 유망 기업에서는 최대 20% 까지 달함.
B. 작업 시험 (Work Trial) 결과
참가: 97 개 기업 중 20 개가 지원, 8 개가 최종 선정되어 3 일간의 작업 시험 수행.
성과:
컨설팅 기업: 8 개 중 5 개 (63%) 가 기술적 AI 안전 작업에 대한 조건부 또는 완전 추천을 받음. 특히 3 개 기업은 90% 이상의 높은 점수를 기록함.
AI 에이전트: GPT-5 와 Claude Opus 4.1 에이전트는 모두 30~40% 점수에 그쳐 추천을 받지 못함. (작업 완료 및 RTT 평가 수행 실패).
결론: 현재 AI 에이전트보다 유능한 컨설팅 기업들이 존재하며, 이들은 복잡한 ML R&D 과제를 수행할 수 있음.
C. 한계점 및 오차
데이터 편향: LinkedIn 데이터는 특정 지역 (비서구권) 이나 공개적 발자국이 적은 기업을 과소평가할 수 있음.
모델 오차: Anthropic, Meta 등 기존 ML 연구 조직에 대해 모델이 실제보다 낮은 인력 수 (예: Anthropic 2,000 명 중 9 명) 를 추정하는 등, 컨설팅 기업에 맞춰 조정된 사전 확률 (Priors) 이 순수 연구 기관에는 부적합할 수 있음.
4. 주요 기여 (Key Contributions)
최초의 체계적 샘플링: 전 세계 IT 컨설팅 기업 내 ML 연구 인력 풀을 체계적으로 매핑한 최초의 연구.
검증된 추정 파이프라인: 키워드 필터와 LLM 분류기를 결합한 다중 어노테이터 프로빗 모델을 개발하여 대규모 인력 데이터에서 기술 역량을 정량화하는 방법론 제시.
실증적 검증: 추정을 넘어 실제 작업 과제를 통해 인간 전문가 (컨설팅 기업) 와 AI 에이전트의 능력을 비교, 컨설팅 산업이 AI 안전 연구에 실질적으로 기여할 수 있음을 입증.
5. 의의 및 결론 (Significance & Conclusion)
확장 가능한 자원: AI 안전 및 정렬 연구를 위한 기술적 인력 부족 문제를 해결할 수 있는 수천 명 규모의 유능한 인재 풀이 IT 컨설팅 산업에 잠재해 있음을 발견했습니다.
실용적 경로: 기존 MATS(ML Alignment & Theory Scholars) 프로그램 등 소규모 지원만으로는 부족하며, 컨설팅 기업을 통한 대규모 인력 동원이 AI 안전 연구 역량을 급격히 확장할 수 있는 현실적인 경로입니다.
정책적 시사점: 자금 지원자 (Funders) 와 프로그램 관리자는 컨설팅 기업을 단일 집단으로 보지 말고, 기술적 역량이 높은 특정 하위 단위 (Sub-units) 를 타겟팅하여 협력해야 함을 강조합니다.
AI 에이전트의 한계: 현재 AI 에이전트는 복잡한 연구 과제를 수행하는 데 있어 유능한 인간 전문가 (컨설팅 팀) 를 대체할 수 없음을 보여줌.
이 연구는 AI 안전 생태계의 인력 병목 현상을 해결하기 위해, 기존에 간과되었던 IT 컨설팅 산업의 기술적 자원을 활성화해야 함을 강력히 주장합니다.