인간이 만드는 마지막 AI — 재귀적 자기 개선(RSI) 5단계 로드맵과 산업 현장의 증거

개요

  • 주제: AI 시스템이 경험과 피드백을 "영구적인 개선"으로 전환하는 재귀적 자기 개선(Recursive Self-Improvement, RSI)의 개념 정의, 자율성 로드맵(L1~L5), 그리고 실제 산업 적용 증거
  • 핵심 관점: 이 연구는 "어떤 모델이 더 뛰어난가"가 아니라 "개선 루프(improvement loop)"를 분석 단위로 삼는다 — 무엇이 개선을 촉발하고, 누가 변경을 제안·검증하며, 무엇이 다음 세대로 보존되는지를 추적한다
  • 핵심 키워드: RSI, Headroom-Closed Index(HCI), 자율성 계층 B0~L5, 구조적 재귀 vs 효과적 재귀, 개선 루프의 해부학, 환경-데이터-모델 공진화

핵심 메시지 3가지

① "출력이 좋아지는 것"과 "시스템이 좋아지는 것"은 전혀 다른 문제다

Self-Refine, Reflexion, Tree of Thoughts 같은 기법은 한 세션 안에서 출력을 반복 개선하지만, 그 결과는 미래의 독립적인 작업을 위한 영구적 시스템 상태로 보존되지 않는다. 논문은 이를 B0(비-RSI 참조 수준)로 분류한다. RSI의 문턱은 "출력의 변경"이 아니라 "시스템 상태의 변경이 다음 라운드로 상속되는가"에 있다.

② 자율성은 성능이 아니라 "이관된 결정의 범위"로 측정한다

RSI의 자율성은 모델 점수나 자동화된 부품 수가 아니라, 외부 설계자로부터 AI에게 이전된 '개선 결정'의 범위로 정의된다. 이 기준 하나로 L1(개선 실행) → L2(전략 선택) → L3(경험 획득) → L4(환경 적응) → L5(재귀적 상속)의 5단계가 정해진다.

③ 진전은 균등하지 않다 — 격차가 곧 RSI의 기회다

393개 모델-벤치마크 관측치를 HCI로 정규화한 결과, 고급 수학은 HCI 86.4까지 올라간 반면 도구 에이전트는 39.9에 머물렀다. 검증이 쉬운 환경에서의 성장이 길고 상태가 유지되는(stateful) 워크플로우로 균일하게 전이되지 않는다.


1. 왜 지금 RSI인가 — 파운데이션 모델 개발의 세 가지 확장 부담

논문은 현행 LLM 개발이 세 개의 병목에 동시에 짓눌려 있다고 진단한다.

부담 ① 자원 집약적 훈련

항목 원문 수치
Kimi K3 파라미터 2.8조 (컨텍스트 윈도우 약 100만 토큰)
Qwen3.8-Max 파라미터 2.4조 (활성 950억 개)
Kimi K3 효율 896개 전문가 중 16개 활성화 → Kimi K2 대비 2.5배 확장 효율
OpenAI GPT-5.6 개발 내부 코딩 추론용 컴퓨팅 100배, 에이전트 토큰 사용량 22배 증가
OpenAI GDPval 1,320개 전문 작업에 약 9,240시간의 전문가 시간
Humanity's Last Exam 7만 건 이상 제출 시도 중 약 1만 3천 건 난제 검토 → 3,000개 벤치마크 선정

부담 ② 피드백·학습 환경의 확장

  • DeepSeek-V3.2는 사전 학습 비용의 10% 이상을 사후 학습에 투입
  • NVIDIA AIMO-2 파이프라인: 320만 개 장추론 솔루션 + 170만 개 도구 통합 솔루션 생성, 54만 개 문제 큐레이션

부담 ③ 배포 후 반복적 적응

  • Anthropic: 에이전트 워크로드는 일반 채팅 대비 4배, 멀티 에이전트 시스템은 15배의 토큰 사용
  • Meta FBDetect: 매주 수천 개의 인프라 회귀를 식별하지만 진단에 약 10시간의 엔지니어링 시간 소요

세 병목은 모두 같은 형태를 띤다 — 사람이 진단하고, 사람이 규칙을 갱신하고, 사람이 회귀 테스트를 돌린다. RSI는 이 "사람이 매 라운드마다 다시 개입하는 구조"를 끊으려는 시도다.


2. RSI란 무엇인가 — 개선 루프의 해부학

RSI는 AI 시스템이 자신의 한계를 식별하고, 개선 사항을 개발·검증하며, 그 결과를 개선 프로세스 자체를 향상시키는 데 사용하는 자율적 폐루프(closed-loop) 과정으로 정의된다. 세 차원을 함께 갖춘다: 자율성(Autonomy) · 효율성(Efficiency) · 혁신성(Innovation).

개선 루프의 6개 구성 요소

구성 요소 의미
AI 시스템 능력 상태를 추적하는 전체 계산 엔티티
시스템 상태 라운드 간에 유지 및 상속되는 부분
경험 이후 수정을 안내하기 위해 사용되는 이전 상호작용 정보
타겟 현재 라운드에서 직접 수정되는 대상(코드, 검색 방법 등)
개선자(Improver) 현재 상태와 경험을 후보 수정안으로 변환하는 메커니즘
전략(Strategy) 개선자가 후보를 생성하는 방법 — 전략 자체가 유지되면 다음 라운드의 타겟이 된다

인접 패러다임과의 경계

  • 지속적 학습: 학습 목표·업데이트 규칙을 설계자가 고정한다 → 경험에 따라 적응 방식 자체가 수정될 때 RSI로 넘어간다
  • AutoML: 탐색 공간과 평가자가 사전에 주어진다 → 개선 탐색 절차가 영구적 상태가 되어 다음 라운드에 개선될 때 RSI가 된다
  • 에이전틱 AI: 하네스와 수용 기준이 에피소드 내 불변인 경우가 많다 → 검증된 변경이 작업 간에 지속될 때 RSI로 간주된다

3. 자율성 로드맵 B0~L5 — 무엇이 이전되고 무엇이 인간에게 남는가

단계별 요약

단계 이관되는 결정 대표 구현 핵심 한계
B0 없음(비-RSI) Self-Refine, Reflexion, Tree of Thoughts 태스크 간 경험 미축적, 고정 평가 기준
L1 개선 실행 FineWeb-Edu, NeMo Curator, HealthBench, Meta Capacity Efficiency 절차가 외부 고정, 오류가 후속 단계로 전파
L2 개선 전략 선택 GEPA, Agent Optimizer, ADAS, AFlow, TAO, GPT-6 Astra, AutoKernel 벤치마크 과적합·평가자 공유 맹점·시드 체리피킹
L3 미래 학습 경험 획득 SSP, AZR, R-Zero, STP, PSV, VisPlay, VOYAGER, SIMA 2, SEAgent 경험 오염, 보상 판단 부정확성
L4 배포·환경 적응 Dynamic Cheatsheet, ACE, ReasoningBank, Trace2Skill, PRACTICE, PANDO, Metis, DecoEvo, HDSO Library Drift, 무제한 축적 시 검색 품질 저하
L5 재귀적 상속(메커니즘 자체) STOP, Gödel Agent, DGM, RQGM, A-Evolve-Training, HyperAgents 오류 상속, 효과적 재귀 미입증

L1 → L2의 분기점

L1은 "개선 목표 수신 → 규정된 절차 실행 → 개선 산출 → 시스템 상태 업데이트 → 다음 태스크 처리"의 고정 루프다. L2부터 루프가 "관찰 → 진단 → 변경 방법 선택 → 인스턴스화 및 테스트 → 유지 또는 롤백 → 반복"으로 바뀐다. 자율성의 핵심은 프롬프트 생성 자체가 아니라 "다음에 시도할 수정 전략"을 누가 통제하는가다.

L3의 판별 기준

L3는 단순한 데이터 파이프라인 자동화나 일회성 필터링이 아니다. 학습자 상태 관찰 → 경험 선택 → 경험 획득 → 영구 상태 업데이트 → 미래 경험 재형성의 폐루프가 성립해야 한다. AZR은 코드 실행기로 제안 작업을 검증하고 학습 가능성 보상으로 제안을 안내하며, R-Zero는 외부 정답 라벨 없이 해결자 답변 일관성을 프록시 신호로 쓴다.

L4의 숨은 난제 — "무엇을 남길 것인가"

Metis는 반복 재사용되는 텍스트 계획을 샌드박스 컴파일·실행 검증 후에만 호출 가능한 도구로 승격한다. HDSO는 현재 저장소(대조군)와 후보 스킬(실험군)을 동일 태스크로 이중 실행해 차이를 검증한 뒤 승인한다. DecoEvo는 솔버 스킬과 루브릭 생성기 스킬을 공진화시키되 목표 함수를 분리하고 최적화 중 골든 루브릭을 숨겨, "판단자 개선으로 인한 점수 상승"이라는 순환성을 차단한다.

L5 — 구조적 재귀와 효과적 재귀의 갈림길

구조적 재귀: 수정된 개선 메커니즘이 이후 라운드를 실제로 지배하는가 효과적 재귀: 동일 예산 하에서 더 강한 후속 세대를 생성하는가

시스템 성과 한계(원문 기준)
Darwin Gödel Machine SWE-bench 하위 집합 20% → 50% 아카이브 유지·부모 선택 규칙이 자기 수정 범위 밖
Gödel Agent 정책+재귀 업데이트 로직에 접근 권한 부여 MGSM 최적화 100회 시도 중 14%가 초기 정책보다 성능 저하
RQGM Polyglot 코딩 71.7% 통과율 앵커와 교체 일정은 외부적으로 고정
A-Evolve-Training 30B 모델 4라운드 자율 후처리, 외부 점수 0.80 → 0.86 (인간 최고 제출 0.87) 기본 워커 기판·헌법은 고정
HyperAgents 메타 에이전트 코드 노출 200회 반복 실험에서 통계적으로 유의미한 최종 이점 미입증
Weco AIDE 100단계 무인 실행 중 7번 개선, 외부 작업 전이 보고 효율성 이점의 통계적 유의미성 미발견

4. HCI 데이터가 드러낸 격차 — 393개 관측치의 3가지 관찰

영역 2026 HCI 2026년 증가분 관찰
고급 수학 86.4 53.6점 가속화
대학원 수준 과학 85.8 — 高位 안정
법률 추론 64.5 — 중간권 정체
멀티모달 추론 62.2 2.5점 2025 급성장 후 정체
검색/터미널 에이전트 56.8 — 인터랙티브 격차
소프트웨어 공학 52.6 — 인터랙티브 격차
도구 에이전트 39.9 — 최저권

관찰 ① — 영역별 진전 속도와 크기가 상이하다. 수학은 2026년 증가분이 53.6점인 반면 멀티모달은 2.5점에 그쳤다.

관찰 ② — 소프트웨어 공학(52.6)·검색/터미널 에이전트(56.8)·도구 에이전트(39.9)는 과학 영역 대비 HCI가 30~46점 낮다.

관찰 ③ — RSI의 잠재적 가치는 남은 헤드룸에 집중된다. 2026년 이후 RSI 적용 시 소프트웨어 공학 52.6 → 89.6, 도구 에이전트 39.9 → 86.8의 개선이 기대된다.

연구 지형의 분포 (491편 분석)

자율성 수준 비중
L1 43.8%
L2 31.6%
L3 13.0%
L4 5.7%
L5 5.9%

L1+L2가 75.4%를 차지한다. 즉 현재 연구의 4분의 3은 아직 "인간이 정의한 것을 잘 실행하는" 단계에 머물러 있다.


5. 산업 현장의 RSI — 자체 보고 수치로 본 실증

기업/시스템 루프 구조 보고 수치
Theseus 환경 재구성 → 난이도 사례 발견 → 태스크 모델 학습 → 환경 반복(환경-데이터-모델 공진화) 깨끗한 워크스페이스에서 8개 모델-하네스 조합 통과율 21.7~51.6%p 상승 / 재구성 환경(5개 고정 조합) 루브릭 점수 18.65~39.67%p 향상, 단 일부 태스크에서 scope-creep 회귀
Lark 협업 데이터(문서·메시지·회의)를 엔티티·이벤트·관계로 구조화 → 자동 평가(절대/GSB) → 오류 귀속 인간 평가 작업 사용성 52% → 65%, 자동 평가 사용성 47% → 56%, 초기 자동 평가기와 인간 판단 일치율 약 84%
Xiaohongshu (IMA) 내 루프: 온라인 피드백으로 사용자 메모리 실시간 갱신 / 외 루프: 어려운 사례 채굴·검증 → 파라미터 후처리 학습 Discovery Feed score_mean@16 2.211 → 2.366 (7.0%), score_median@16 4.8% 증가 / In-video Feed 1.537 → 1.739(약 13.1%) — 단 각각 470, 447 샘플 기반 오프라인 예비 결과
Humanlaya 내 루프: 현재 배치 결함 수정 / 외 루프: 반복 실패 분석 → 규칙·프롬프트·스킬 버전화 V0→V4 4회 업데이트 후 주요 결함 패키지 비율 9.0% → 3.7%, 평균 인간 처리 시간 48분 → 27분
ModelBest (ForgeTrain) 프로젝트 내 최적화 + 프로젝트 간 경험 재사용 2단계 루프 빈 디렉터리에서 약 8시간 만에 Megatron-LM v0.15 동등 프레임워크 생성, 1.5~2.5일 내 능가 (기존 3~5명 엔지니어 × 6~12개월) / MiniCPM4-0.5B FLOPs 활용률 40.1% → 44.1%, 8B 47.0% → 50.9% / ForgeStencil 과학 계산 커널 최대 1.9배
Tencent Hunyuan (Hyra) Context Agent가 과거 경험 재조합 → Proposal Agent 병렬 샌드박스 실행 → 평가 메커니즘 자체 개선 NanoChat AutoResearch 검증 BPB 0.9015(기존 0.9109), NanoGPT Speedrun 76.4초(기존 77.5초), SOL-ExecBench 0.771(기존 0.754)
Agent-Native Research Lab ARA(에이전트 네이티브 연구 아티팩트) + Lean 4 결정론적 검증 질문 답변 정확도 72.4% → 93.7%, RE-Bench 재현 성공률 57.4% → 64.4% / Chip-Bench Level-3 CPU 최적화 5.8416, 표준 에이전트 대비 2.7% 빠르고 21.5% 작은 면적
Frontis.AI (ME-WE-MA) 300개+ 전문 에이전트(WE) 수행 → 메타 에이전트(MA) 실패 진단 → 3단계 게이트(회귀 안전성·목표 달성·강건성) → 인간 승인 배포 2개월간 216개 개선 태스크·117개 전문가 에이전트, 평균 점수 5.25 → 5.87, 사이클당 중앙 처리 시간 27.8분, 메타 진화 경험 활용 시 신규 태스크 진화 약 20% 더 빠름 / Frontis-MA1 35B MLE-Bench Lite 39.39% → 60.61%(추가 탐색 시 71.21%) — 기업 자체 보고, 독립 복제 아님

4대 응용 영역의 피드백 특성

영역 피드백 성격 대표 시스템 근본 제약
과학(S1) 희소·지연·비식별적 HypoForge, CASCADE, SkillFoundry, DrugSAGE, SciEvo(1,590개 태스크·925개 진화 도구) 실패가 가설 오류인지 모델 부적절인지 프로토콜 무효인지 계측기 문제인지 귀인 불가
구형 지능(S2) 물리적 인과 피드백 POET, Voyager, VLAW, World-VLA-Loop 실세계 테스트 비용·안전 문제로 시뮬레이션·외부 보상 함수 의존
소프트웨어 공학(S3) 코드 기반 직접 피드백 SWE-Exp, Self-Harness, DGM, Ouroboros 가장 명확한 영구 진화 증거, 단 벤치마크·선택 규칙이 외부 정의
의료(S4) 종단적 임상 피드백 MedAgent-Zero, EvoClinician, MACRO, HealthFlow 결과 지연·혼란 변수로 시뮬레이션 중심, 전문가 승인·가역성 전제

DrugSAGE의 경우 16개 태스크에서 수집된 경험이 17개 홀드아웃 태스크의 성능을 개선했다 — 상속된 경험이 새로운 문제의 행동을 바꾼다는 직접 증거다.


6. RSI가 넘어야 할 8개의 문턱

  1. 교차 구성 요소 진단 및 조정된 개선 — L1→L2 전환 시 실패 원인을 데이터·모델·평가기로 정확히 규명. 잘못된 진단은 부적절한 개입으로 직결된다.
  2. 학습자 조건부 경험 획득 및 신뢰할 수 있는 학습 신호 — 경험의 유효성·난이도·지속적 이점을 분리하고, 다중 라운드에 걸친 학습 가치 추정이 필요하다.
  3. 지속적 상태 관리 및 신뢰할 수 있는 재사용 — Library Drift를 막으려면 아티팩트의 적용 조건·의존성·후속 효과를 증거와 연결해 관리하고, 기여도 감소 스킬을 은퇴(retire)하는 수명주기 관리가 필수다.
  4. 도메인 특화 피드백 하의 거버넌스 적응 — 물리·의료 분야는 되돌릴 수 없는 결과를 막기 위해 사전 배포 검증과 인간 권한 통제가 요구된다.
  5. 개선 메커니즘의 신뢰할 수 있는 진화 — RQGM처럼 평가기를 에폭 내 동결하고 독립적 ground-truth 앵커로 교체하며, 제안자-평가기 간 오류 공조를 탐지해야 한다.
  6. 상속된 개선 능력의 장기 평가 — 구조적 증거와 효과적 증거를 구분하고, 총 예산을 맞춘 비교와 완전한 궤적 보고가 필요하다.
  7. 자원 인식 개선 및 인간 협업 — 진단·탐색·검증·인간 검토의 전체 비용을 함께 계산해야 한다.
  8. 교차 라운드 상속을 위한 재현 가능한 인프라 — 성공과 실패 모두의 증거·코드·사양을 보존하는 공유 인프라.

관점 포인트 — 실무자가 짚어야 할 7가지

  • "자동화"와 "RSI"를 혼동하지 마라. 자동화된 최적화·지속 학습·에이전틱 AI는 각각 교차하지만, 검증된 변경이 다음 라운드에 상속될 때만 RSI다.
  • 성과 수치만 보고 L5로 판단하지 마라. DGM은 20%→50%를 냈지만 아카이브 유지·부모 선택 규칙은 자기 수정 범위 밖에 있었다. 구조적 재귀와 효과적 재귀를 분리해서 물어보라.
  • 평가자를 방 안에 두지 마라. 반복적인 개발 세트 접근은 능력 향상보다 평가자 악용을 보상한다. DecoEvo의 목표 함수 분리, RQGM의 평가자 동결+독립 앵커가 최소 방어선이다.
  • 메모리는 쌓는 게 아니라 관리하는 것이다. 무제한 축적은 검색 품질을 저하시킨다. 스킬 수 제한·은퇴·이중 실행 검증(HDSO)이 없는 L4는 오히려 퇴행한다.
  • 귀인 불가능한 피드백에서는 RSI가 작동하지 않는다. 과학·의료 영역의 지연·희소·비식별 피드백은 "무엇을 고칠지"를 알려주지 않는다.
  • 산업 사례는 대부분 자체 보고다. Xiaohongshu 수치는 470/447 샘플 오프라인 예비 결과이고, Frontis 수치도 독립 복제가 아니다. 벤치마킹 시 이 단서를 반드시 함께 옮겨 적으라.
  • 인간에게 남는 것이 명확히 정의되어 있다. 각 단계에서 인간은 미션, 안전 경계, 보호된 평가, 자원 권한, 최종 수용을 유지한다. 로드맵은 인간 제거가 아니라 결정의 이관 범위 확장이다.

최종 핵심 정리 — 확인해야 할 질문

  1. 이 시스템의 변경 사항은 다음 라운드에도 살아남는가? (B0 vs L1의 분기)
  2. 다음에 무엇을 고칠지 누가 결정하는가? (L1 vs L2의 분기)
  3. 학습자 상태가 다음 학습 의제를 바꾸는가? (L2 vs L3의 분기)
  4. 배포 중 피드백이 영구 상태에 어떻게 진입하며, 무엇이 은퇴하는가? (L3 vs L4의 분기)
  5. 수정된 개선 메커니즘이 이후 라운드를 실제로 지배하는가(구조적), 그리고 동등 예산에서 더 강한 후속 세대를 만드는가(효과적)? (L4 vs L5의 분기)
  6. 성공뿐 아니라 실패의 증거·코드·사양도 상속되고 있는가?

한 줄 요약: RSI의 진짜 증거는 점수 상승이 아니라, 명시적 자원·권한 제약 하에서 상속된 변경 사항이 후속 라운드의 경험 획득·개입 발견·검증을 반복적으로 돕는 능력이다.