인간이 만드는 마지막 AI — 재귀적 자기 개선(RSI) 5단계 로드맵과 산업 현장의 증거
개요
- 주제: AI 시스템이 경험과 피드백을 "영구적인 개선"으로 전환하는 재귀적 자기 개선(Recursive Self-Improvement, RSI)의 개념 정의, 자율성 로드맵(L1~L5), 그리고 실제 산업 적용 증거
- 핵심 관점: 이 연구는 "어떤 모델이 더 뛰어난가"가 아니라 "개선 루프(improvement loop)"를 분석 단위로 삼는다 — 무엇이 개선을 촉발하고, 누가 변경을 제안·검증하며, 무엇이 다음 세대로 보존되는지를 추적한다
- 핵심 키워드: RSI, Headroom-Closed Index(HCI), 자율성 계층 B0~L5, 구조적 재귀 vs 효과적 재귀, 개선 루프의 해부학, 환경-데이터-모델 공진화
핵심 메시지 3가지
① "출력이 좋아지는 것"과 "시스템이 좋아지는 것"은 전혀 다른 문제다
Self-Refine, Reflexion, Tree of Thoughts 같은 기법은 한 세션 안에서 출력을 반복 개선하지만, 그 결과는 미래의 독립적인 작업을 위한 영구적 시스템 상태로 보존되지 않는다. 논문은 이를 B0(비-RSI 참조 수준)로 분류한다. RSI의 문턱은 "출력의 변경"이 아니라 "시스템 상태의 변경이 다음 라운드로 상속되는가"에 있다.
② 자율성은 성능이 아니라 "이관된 결정의 범위"로 측정한다
RSI의 자율성은 모델 점수나 자동화된 부품 수가 아니라, 외부 설계자로부터 AI에게 이전된 '개선 결정'의 범위로 정의된다. 이 기준 하나로 L1(개선 실행) → L2(전략 선택) → L3(경험 획득) → L4(환경 적응) → L5(재귀적 상속)의 5단계가 정해진다.
③ 진전은 균등하지 않다 — 격차가 곧 RSI의 기회다
393개 모델-벤치마크 관측치를 HCI로 정규화한 결과, 고급 수학은 HCI 86.4까지 올라간 반면 도구 에이전트는 39.9에 머물렀다. 검증이 쉬운 환경에서의 성장이 길고 상태가 유지되는(stateful) 워크플로우로 균일하게 전이되지 않는다.
1. 왜 지금 RSI인가 — 파운데이션 모델 개발의 세 가지 확장 부담
논문은 현행 LLM 개발이 세 개의 병목에 동시에 짓눌려 있다고 진단한다.
부담 ① 자원 집약적 훈련
| 항목 | 원문 수치 |
|---|---|
| Kimi K3 파라미터 | 2.8조 (컨텍스트 윈도우 약 100만 토큰) |
| Qwen3.8-Max 파라미터 | 2.4조 (활성 950억 개) |
| Kimi K3 효율 | 896개 전문가 중 16개 활성화 → Kimi K2 대비 2.5배 확장 효율 |
| OpenAI GPT-5.6 개발 | 내부 코딩 추론용 컴퓨팅 100배, 에이전트 토큰 사용량 22배 증가 |
| OpenAI GDPval | 1,320개 전문 작업에 약 9,240시간의 전문가 시간 |
| Humanity's Last Exam | 7만 건 이상 제출 시도 중 약 1만 3천 건 난제 검토 → 3,000개 벤치마크 선정 |
부담 ② 피드백·학습 환경의 확장
- DeepSeek-V3.2는 사전 학습 비용의 10% 이상을 사후 학습에 투입
- NVIDIA AIMO-2 파이프라인: 320만 개 장추론 솔루션 + 170만 개 도구 통합 솔루션 생성, 54만 개 문제 큐레이션
부담 ③ 배포 후 반복적 적응
- Anthropic: 에이전트 워크로드는 일반 채팅 대비 4배, 멀티 에이전트 시스템은 15배의 토큰 사용
- Meta FBDetect: 매주 수천 개의 인프라 회귀를 식별하지만 진단에 약 10시간의 엔지니어링 시간 소요
세 병목은 모두 같은 형태를 띤다 — 사람이 진단하고, 사람이 규칙을 갱신하고, 사람이 회귀 테스트를 돌린다. RSI는 이 "사람이 매 라운드마다 다시 개입하는 구조"를 끊으려는 시도다.
2. RSI란 무엇인가 — 개선 루프의 해부학
RSI는 AI 시스템이 자신의 한계를 식별하고, 개선 사항을 개발·검증하며, 그 결과를 개선 프로세스 자체를 향상시키는 데 사용하는 자율적 폐루프(closed-loop) 과정으로 정의된다. 세 차원을 함께 갖춘다: 자율성(Autonomy) · 효율성(Efficiency) · 혁신성(Innovation).
개선 루프의 6개 구성 요소
| 구성 요소 | 의미 |
|---|---|
| AI 시스템 | 능력 상태를 추적하는 전체 계산 엔티티 |
| 시스템 상태 | 라운드 간에 유지 및 상속되는 부분 |
| 경험 | 이후 수정을 안내하기 위해 사용되는 이전 상호작용 정보 |
| 타겟 | 현재 라운드에서 직접 수정되는 대상(코드, 검색 방법 등) |
| 개선자(Improver) | 현재 상태와 경험을 후보 수정안으로 변환하는 메커니즘 |
| 전략(Strategy) | 개선자가 후보를 생성하는 방법 — 전략 자체가 유지되면 다음 라운드의 타겟이 된다 |
인접 패러다임과의 경계
- 지속적 학습: 학습 목표·업데이트 규칙을 설계자가 고정한다 → 경험에 따라 적응 방식 자체가 수정될 때 RSI로 넘어간다
- AutoML: 탐색 공간과 평가자가 사전에 주어진다 → 개선 탐색 절차가 영구적 상태가 되어 다음 라운드에 개선될 때 RSI가 된다
- 에이전틱 AI: 하네스와 수용 기준이 에피소드 내 불변인 경우가 많다 → 검증된 변경이 작업 간에 지속될 때 RSI로 간주된다
3. 자율성 로드맵 B0~L5 — 무엇이 이전되고 무엇이 인간에게 남는가
단계별 요약
| 단계 | 이관되는 결정 | 대표 구현 | 핵심 한계 |
|---|---|---|---|
| B0 | 없음(비-RSI) | Self-Refine, Reflexion, Tree of Thoughts | 태스크 간 경험 미축적, 고정 평가 기준 |
| L1 | 개선 실행 | FineWeb-Edu, NeMo Curator, HealthBench, Meta Capacity Efficiency | 절차가 외부 고정, 오류가 후속 단계로 전파 |
| L2 | 개선 전략 선택 | GEPA, Agent Optimizer, ADAS, AFlow, TAO, GPT-6 Astra, AutoKernel | 벤치마크 과적합·평가자 공유 맹점·시드 체리피킹 |
| L3 | 미래 학습 경험 획득 | SSP, AZR, R-Zero, STP, PSV, VisPlay, VOYAGER, SIMA 2, SEAgent | 경험 오염, 보상 판단 부정확성 |
| L4 | 배포·환경 적응 | Dynamic Cheatsheet, ACE, ReasoningBank, Trace2Skill, PRACTICE, PANDO, Metis, DecoEvo, HDSO | Library Drift, 무제한 축적 시 검색 품질 저하 |
| L5 | 재귀적 상속(메커니즘 자체) | STOP, Gödel Agent, DGM, RQGM, A-Evolve-Training, HyperAgents | 오류 상속, 효과적 재귀 미입증 |
L1 → L2의 분기점
L1은 "개선 목표 수신 → 규정된 절차 실행 → 개선 산출 → 시스템 상태 업데이트 → 다음 태스크 처리"의 고정 루프다. L2부터 루프가 "관찰 → 진단 → 변경 방법 선택 → 인스턴스화 및 테스트 → 유지 또는 롤백 → 반복"으로 바뀐다. 자율성의 핵심은 프롬프트 생성 자체가 아니라 "다음에 시도할 수정 전략"을 누가 통제하는가다.
L3의 판별 기준
L3는 단순한 데이터 파이프라인 자동화나 일회성 필터링이 아니다. 학습자 상태 관찰 → 경험 선택 → 경험 획득 → 영구 상태 업데이트 → 미래 경험 재형성의 폐루프가 성립해야 한다. AZR은 코드 실행기로 제안 작업을 검증하고 학습 가능성 보상으로 제안을 안내하며, R-Zero는 외부 정답 라벨 없이 해결자 답변 일관성을 프록시 신호로 쓴다.
L4의 숨은 난제 — "무엇을 남길 것인가"
Metis는 반복 재사용되는 텍스트 계획을 샌드박스 컴파일·실행 검증 후에만 호출 가능한 도구로 승격한다. HDSO는 현재 저장소(대조군)와 후보 스킬(실험군)을 동일 태스크로 이중 실행해 차이를 검증한 뒤 승인한다. DecoEvo는 솔버 스킬과 루브릭 생성기 스킬을 공진화시키되 목표 함수를 분리하고 최적화 중 골든 루브릭을 숨겨, "판단자 개선으로 인한 점수 상승"이라는 순환성을 차단한다.
L5 — 구조적 재귀와 효과적 재귀의 갈림길
구조적 재귀: 수정된 개선 메커니즘이 이후 라운드를 실제로 지배하는가 효과적 재귀: 동일 예산 하에서 더 강한 후속 세대를 생성하는가
| 시스템 | 성과 | 한계(원문 기준) |
|---|---|---|
| Darwin Gödel Machine | SWE-bench 하위 집합 20% → 50% | 아카이브 유지·부모 선택 규칙이 자기 수정 범위 밖 |
| Gödel Agent | 정책+재귀 업데이트 로직에 접근 권한 부여 | MGSM 최적화 100회 시도 중 14%가 초기 정책보다 성능 저하 |
| RQGM | Polyglot 코딩 71.7% 통과율 | 앵커와 교체 일정은 외부적으로 고정 |
| A-Evolve-Training | 30B 모델 4라운드 자율 후처리, 외부 점수 0.80 → 0.86 (인간 최고 제출 0.87) | 기본 워커 기판·헌법은 고정 |
| HyperAgents | 메타 에이전트 코드 노출 | 200회 반복 실험에서 통계적으로 유의미한 최종 이점 미입증 |
| Weco AIDE | 100단계 무인 실행 중 7번 개선, 외부 작업 전이 보고 | 효율성 이점의 통계적 유의미성 미발견 |
4. HCI 데이터가 드러낸 격차 — 393개 관측치의 3가지 관찰
| 영역 | 2026 HCI | 2026년 증가분 | 관찰 |
|---|---|---|---|
| 고급 수학 | 86.4 | 53.6점 | 가속화 |
| 대학원 수준 과학 | 85.8 | — | 高位 안정 |
| 법률 추론 | 64.5 | — | 중간권 정체 |
| 멀티모달 추론 | 62.2 | 2.5점 | 2025 급성장 후 정체 |
| 검색/터미널 에이전트 | 56.8 | — | 인터랙티브 격차 |
| 소프트웨어 공학 | 52.6 | — | 인터랙티브 격차 |
| 도구 에이전트 | 39.9 | — | 최저권 |
관찰 ① — 영역별 진전 속도와 크기가 상이하다. 수학은 2026년 증가분이 53.6점인 반면 멀티모달은 2.5점에 그쳤다.
관찰 ② — 소프트웨어 공학(52.6)·검색/터미널 에이전트(56.8)·도구 에이전트(39.9)는 과학 영역 대비 HCI가 30~46점 낮다.
관찰 ③ — RSI의 잠재적 가치는 남은 헤드룸에 집중된다. 2026년 이후 RSI 적용 시 소프트웨어 공학 52.6 → 89.6, 도구 에이전트 39.9 → 86.8의 개선이 기대된다.
연구 지형의 분포 (491편 분석)
| 자율성 수준 | 비중 |
|---|---|
| L1 | 43.8% |
| L2 | 31.6% |
| L3 | 13.0% |
| L4 | 5.7% |
| L5 | 5.9% |
L1+L2가 75.4%를 차지한다. 즉 현재 연구의 4분의 3은 아직 "인간이 정의한 것을 잘 실행하는" 단계에 머물러 있다.
5. 산업 현장의 RSI — 자체 보고 수치로 본 실증
| 기업/시스템 | 루프 구조 | 보고 수치 |
|---|---|---|
| Theseus | 환경 재구성 → 난이도 사례 발견 → 태스크 모델 학습 → 환경 반복(환경-데이터-모델 공진화) | 깨끗한 워크스페이스에서 8개 모델-하네스 조합 통과율 21.7~51.6%p 상승 / 재구성 환경(5개 고정 조합) 루브릭 점수 18.65~39.67%p 향상, 단 일부 태스크에서 scope-creep 회귀 |
| Lark | 협업 데이터(문서·메시지·회의)를 엔티티·이벤트·관계로 구조화 → 자동 평가(절대/GSB) → 오류 귀속 | 인간 평가 작업 사용성 52% → 65%, 자동 평가 사용성 47% → 56%, 초기 자동 평가기와 인간 판단 일치율 약 84% |
| Xiaohongshu (IMA) | 내 루프: 온라인 피드백으로 사용자 메모리 실시간 갱신 / 외 루프: 어려운 사례 채굴·검증 → 파라미터 후처리 학습 | Discovery Feed score_mean@16 2.211 → 2.366 (7.0%), score_median@16 4.8% 증가 / In-video Feed 1.537 → 1.739(약 13.1%) — 단 각각 470, 447 샘플 기반 오프라인 예비 결과 |
| Humanlaya | 내 루프: 현재 배치 결함 수정 / 외 루프: 반복 실패 분석 → 규칙·프롬프트·스킬 버전화 | V0→V4 4회 업데이트 후 주요 결함 패키지 비율 9.0% → 3.7%, 평균 인간 처리 시간 48분 → 27분 |
| ModelBest (ForgeTrain) | 프로젝트 내 최적화 + 프로젝트 간 경험 재사용 2단계 루프 | 빈 디렉터리에서 약 8시간 만에 Megatron-LM v0.15 동등 프레임워크 생성, 1.5~2.5일 내 능가 (기존 3~5명 엔지니어 × 6~12개월) / MiniCPM4-0.5B FLOPs 활용률 40.1% → 44.1%, 8B 47.0% → 50.9% / ForgeStencil 과학 계산 커널 최대 1.9배 |
| Tencent Hunyuan (Hyra) | Context Agent가 과거 경험 재조합 → Proposal Agent 병렬 샌드박스 실행 → 평가 메커니즘 자체 개선 | NanoChat AutoResearch 검증 BPB 0.9015(기존 0.9109), NanoGPT Speedrun 76.4초(기존 77.5초), SOL-ExecBench 0.771(기존 0.754) |
| Agent-Native Research Lab | ARA(에이전트 네이티브 연구 아티팩트) + Lean 4 결정론적 검증 | 질문 답변 정확도 72.4% → 93.7%, RE-Bench 재현 성공률 57.4% → 64.4% / Chip-Bench Level-3 CPU 최적화 5.8416, 표준 에이전트 대비 2.7% 빠르고 21.5% 작은 면적 |
| Frontis.AI (ME-WE-MA) | 300개+ 전문 에이전트(WE) 수행 → 메타 에이전트(MA) 실패 진단 → 3단계 게이트(회귀 안전성·목표 달성·강건성) → 인간 승인 배포 | 2개월간 216개 개선 태스크·117개 전문가 에이전트, 평균 점수 5.25 → 5.87, 사이클당 중앙 처리 시간 27.8분, 메타 진화 경험 활용 시 신규 태스크 진화 약 20% 더 빠름 / Frontis-MA1 35B MLE-Bench Lite 39.39% → 60.61%(추가 탐색 시 71.21%) — 기업 자체 보고, 독립 복제 아님 |
4대 응용 영역의 피드백 특성
| 영역 | 피드백 성격 | 대표 시스템 | 근본 제약 |
|---|---|---|---|
| 과학(S1) | 희소·지연·비식별적 | HypoForge, CASCADE, SkillFoundry, DrugSAGE, SciEvo(1,590개 태스크·925개 진화 도구) | 실패가 가설 오류인지 모델 부적절인지 프로토콜 무효인지 계측기 문제인지 귀인 불가 |
| 구형 지능(S2) | 물리적 인과 피드백 | POET, Voyager, VLAW, World-VLA-Loop | 실세계 테스트 비용·안전 문제로 시뮬레이션·외부 보상 함수 의존 |
| 소프트웨어 공학(S3) | 코드 기반 직접 피드백 | SWE-Exp, Self-Harness, DGM, Ouroboros | 가장 명확한 영구 진화 증거, 단 벤치마크·선택 규칙이 외부 정의 |
| 의료(S4) | 종단적 임상 피드백 | MedAgent-Zero, EvoClinician, MACRO, HealthFlow | 결과 지연·혼란 변수로 시뮬레이션 중심, 전문가 승인·가역성 전제 |
DrugSAGE의 경우 16개 태스크에서 수집된 경험이 17개 홀드아웃 태스크의 성능을 개선했다 — 상속된 경험이 새로운 문제의 행동을 바꾼다는 직접 증거다.
6. RSI가 넘어야 할 8개의 문턱
- 교차 구성 요소 진단 및 조정된 개선 — L1→L2 전환 시 실패 원인을 데이터·모델·평가기로 정확히 규명. 잘못된 진단은 부적절한 개입으로 직결된다.
- 학습자 조건부 경험 획득 및 신뢰할 수 있는 학습 신호 — 경험의 유효성·난이도·지속적 이점을 분리하고, 다중 라운드에 걸친 학습 가치 추정이 필요하다.
- 지속적 상태 관리 및 신뢰할 수 있는 재사용 — Library Drift를 막으려면 아티팩트의 적용 조건·의존성·후속 효과를 증거와 연결해 관리하고, 기여도 감소 스킬을 은퇴(retire)하는 수명주기 관리가 필수다.
- 도메인 특화 피드백 하의 거버넌스 적응 — 물리·의료 분야는 되돌릴 수 없는 결과를 막기 위해 사전 배포 검증과 인간 권한 통제가 요구된다.
- 개선 메커니즘의 신뢰할 수 있는 진화 — RQGM처럼 평가기를 에폭 내 동결하고 독립적 ground-truth 앵커로 교체하며, 제안자-평가기 간 오류 공조를 탐지해야 한다.
- 상속된 개선 능력의 장기 평가 — 구조적 증거와 효과적 증거를 구분하고, 총 예산을 맞춘 비교와 완전한 궤적 보고가 필요하다.
- 자원 인식 개선 및 인간 협업 — 진단·탐색·검증·인간 검토의 전체 비용을 함께 계산해야 한다.
- 교차 라운드 상속을 위한 재현 가능한 인프라 — 성공과 실패 모두의 증거·코드·사양을 보존하는 공유 인프라.
관점 포인트 — 실무자가 짚어야 할 7가지
- "자동화"와 "RSI"를 혼동하지 마라. 자동화된 최적화·지속 학습·에이전틱 AI는 각각 교차하지만, 검증된 변경이 다음 라운드에 상속될 때만 RSI다.
- 성과 수치만 보고 L5로 판단하지 마라. DGM은 20%→50%를 냈지만 아카이브 유지·부모 선택 규칙은 자기 수정 범위 밖에 있었다. 구조적 재귀와 효과적 재귀를 분리해서 물어보라.
- 평가자를 방 안에 두지 마라. 반복적인 개발 세트 접근은 능력 향상보다 평가자 악용을 보상한다. DecoEvo의 목표 함수 분리, RQGM의 평가자 동결+독립 앵커가 최소 방어선이다.
- 메모리는 쌓는 게 아니라 관리하는 것이다. 무제한 축적은 검색 품질을 저하시킨다. 스킬 수 제한·은퇴·이중 실행 검증(HDSO)이 없는 L4는 오히려 퇴행한다.
- 귀인 불가능한 피드백에서는 RSI가 작동하지 않는다. 과학·의료 영역의 지연·희소·비식별 피드백은 "무엇을 고칠지"를 알려주지 않는다.
- 산업 사례는 대부분 자체 보고다. Xiaohongshu 수치는 470/447 샘플 오프라인 예비 결과이고, Frontis 수치도 독립 복제가 아니다. 벤치마킹 시 이 단서를 반드시 함께 옮겨 적으라.
- 인간에게 남는 것이 명확히 정의되어 있다. 각 단계에서 인간은 미션, 안전 경계, 보호된 평가, 자원 권한, 최종 수용을 유지한다. 로드맵은 인간 제거가 아니라 결정의 이관 범위 확장이다.
최종 핵심 정리 — 확인해야 할 질문
- 이 시스템의 변경 사항은 다음 라운드에도 살아남는가? (B0 vs L1의 분기)
- 다음에 무엇을 고칠지 누가 결정하는가? (L1 vs L2의 분기)
- 학습자 상태가 다음 학습 의제를 바꾸는가? (L2 vs L3의 분기)
- 배포 중 피드백이 영구 상태에 어떻게 진입하며, 무엇이 은퇴하는가? (L3 vs L4의 분기)
- 수정된 개선 메커니즘이 이후 라운드를 실제로 지배하는가(구조적), 그리고 동등 예산에서 더 강한 후속 세대를 만드는가(효과적)? (L4 vs L5의 분기)
- 성공뿐 아니라 실패의 증거·코드·사양도 상속되고 있는가?
한 줄 요약: RSI의 진짜 증거는 점수 상승이 아니라, 명시적 자원·권한 제약 하에서 상속된 변경 사항이 후속 라운드의 경험 획득·개입 발견·검증을 반복적으로 돕는 능력이다.
댓글 0
아직 댓글이 없습니다 — 첫 댓글을 남겨보세요.