Column
LinkedIn이 운영 중인 자가진화 에이전트 — 2주 A/B 실측 +9.0pp
LinkedIn의 자가진화 고객지원 에이전트 실측 분석. 진화적 검색으로 프롬프트만 최적화(모델 재훈련 없이), 2주 프로덕션 A/B에서 QA 자가해결 +9.0pp, 라우팅 정확도 +30.6pp.

핵심 요약
- LinkedIn이 운영 중인 "자가진화(self-evolving) 고객지원 에이전트" 시스템 공개 (arXiv:2608.10224, 2026-08-10)
- 실측: 2주간 프로덕션 A/B 테스트에서 QA 자가해결 +9.0pp, 해지 자가해결 +4.8pp, 라우팅 정확도 +30.6pp
- 자가진화는 **프롬프트·검색·평가가 닫힌 루프(closed-loop)**를 이룬 상태에서, 진화적 검색(evolutionary search)으로 프롬프트를 최적화
- 중요: 기반 모델(LLM)을 재훈련하지 않고 프롬프트만 진화 — 비용·리스크 최소화
- Ouroboros/SkillProx의 이론과 달리 실제 엔터프라이즈 규모로 검증된 자가진화의 사례
Ouroboros 글에서 이어지는 "자가진화 실전편"
지난 글 "자가진화의 두 방식"에서 SkillProx(지식 진화)와 Ouroboros(에이전트 진화)라는 두 축을 봤습니다. 그런데 두 논문 모두 실험실/연구 단계였습니다.
이 논문은 다릅니다. LinkedIn이 실제 프로덕션 고객지원 트래픽에 자가진화 에이전트를 배포하고, 2주간 무작위 A/B 테스트로 성능을 측정했습니다. "자가진화가 실무에서 통한다"는 걸 숫자로 보여줍니다.
자가진화가 왜 필요한가 (엔터프라이즈의 현실)
LinkedIn 고객지원의 어려움을 논문은 이렇게 진단합니다:
"Enterprise support agents operate in rapidly changing environments where policies, product capabilities, and knowledge bases evolve continuously, making static assistants brittle and costly to maintain."
즉:
- 정책이 바뀌고
- 제품 기능이 추가/삭제되고
- 지식 베이스가 계속 갱신된다
정적(static) 어시스턴트는 금방 낡아서 유지보수 비용이 커진다. 그래서 시스템이 스스로 적응해야 한다는 것.
닫힌 루프(Closed-Loop) 자가진화 아키텍처
핵심은 **"무엇이 진화하고, 무엇이 고정이냐"**입니다.
무엇이 진화: 프롬프트 정책 (툴 사용법, 톤, 응답 구조)
무엇이 고정: 기반 LLM + 콘텐츠 스냅샷 (각 반복마다)
이 구분이 중요합니다. 모델을 재훈련하지 않고 프롬프트만 진화시키므로:
- 비용이 저렴
- 롤백이 쉬움
- 위험 통제 가능
진화 메커니즘: 진화적 검색 (Evolutionary Search)
프롬프트 최적화를 유전 알고리즘처럼 수행합니다:
1. 프롬프트 개체군(population) 생성 — 톤·툴 사용·추론 깊이·응답 구조의 다양한 조합
2. 각 개체를 태스크 메트릭으로 평가
3. 우수한 개체만 다음 세대로 생존 (선택)
4. 교차(crossover) — 서로 다른 계통의 유용한 지시를 재조합
5. 변이(mutation) — 새 지시를 도입
6. 가장 강한 개체만 다음 반복으로
이 방식이 hill-climbing(언덕 오르기)보다 나은 이유: 단일 후보가 아니라 개체군을 유지하므로, 톤·툴 사용·추론 깊이의 다양한 조합이 공존하다가 좋은 조합이 살아남습니다.
평가: LLM-as-a-judge + 규칙 기반
진화의 품질 신호(fitness)는 두 종류:
- LLM-as-a-judge: 구조적 루브릭으로 groundedness(근거), 관련성, 완전성, 정책 준수 평가
- 규칙 기반 평가자: 확실한 규칙 검증
LLM 판정의 편향은 루브릭·길이 제어로 완화합니다.
운영 가드레일
자가진화가 제멋대로 돌지 않게 가드레일을 겁니다:
- 신뢰성이 전제: 진화 전에 기본 시스템이 신뢰할 수 있어야 함
- 런타임 = 통제된 변이 경계: 프로덕션에서 아무렇게나 변이되지 않게
- 메모리 = 버전화된 아티팩트: 잠재 상태(latent state)가 아니라 버전 관리
- 텔레메트리 = 평가 기반: 이벤트 스트림이 자동 평가를 구동
- 최적화 주기: 보통 주 1회, 콘텐츠 갱신/회귀 감지 시 트리거
중앙집중 실행 패턴
프로덕션에서 핵심으로 확인된 패턴:
"Centralized execution through configuration, modular prompts, and declarative tool selection—rather than per-LoB code forks"
사업부별(LoB) 코드 포크가 아니라 구성·모듈형 프롬프트·선언적 툴 선택으로 중앙집중 실행해야 행동 편차를 막고 개선이 전 워크플로우에 일반화됩니다.
실측 결과: 2주 프로덕션 A/B 테스트
가장 중요한 숫자입니다. 실제 LinkedIn 고객지원 트래픽에서 사용자 무작위 A/B 테스트:
| 메트릭 | 개선 (pp) |
|---|---|
| QA 자가해결 (self-serve) | +9.0 |
| 해지 자가해결 (cancellation self-serve) | +4.8 |
| 라우팅 정확도 | +30.6 |
- QA 자가해결 +9.0pp: 사용자가 상담원 없이 답을 얻는 비율 증가
- 해지 자가해결 +4.8pp: 해지 요청을 상담원 연결 전에 자동 처리
- 라우팅 정확도 +30.6pp: 올바른 담당/리소스로의 연결
이건 단순 벤치마크가 아니라 수익·운영 비용에 직결되는 실제 비즈니스 메트릭입니다.
오프라인 시뮬레이션에서도 환각(hallucination) 감소 + 응답 완전성 향상을 확인했습니다.
이론과 실전의 연결: Ouroboros/SkillProx 대비
| SkillProx | Ouroboros | ||
|---|---|---|---|
| 진화 대상 | 스킬(지식) | 하네스(도구·프롬프트·코어) | 프롬프트 정책 |
| 진화 입력 | 벤치마크 점수 | 실제 작업+소셜 피드백 | 운영 텔레메트리 |
| 검증 주체 | 알고리즘(닫힌 루프) | 인간 리뷰어 | LLM judge + 규칙 |
| 환경 | 실험실 | 161일 배포 | 실제 프로덕션 A/B |
| 검증 방식 | 오프라인 벤치마크 | 궤적 감사 | 2주 무작위 A/B (+9.0pp) |
LinkedIn의 독특한 점은 자가진화가 오프라인 시뮬레이션 → 제한 배포 → 프로덕션 A/B라는 계층적 검증 게이트를 통과한다는 것입니다. 이게 SkillProx가 경고한 "검증 없는 진화는 폭락(EvoSkill 13.0)"을 실전에서 막는 방식입니다.
결론: 자가진화는 실험실 개념이 아니라 운영 원칙이다
이 논문의 핵심 교훈:
"자가진화는 이론이 아니라, 가드레일을 건 운영 원칙이다."
- 모델을 재훈련하지 않고 프롬프트만 진화 → 비용·리스크 최소화
- 진화적 검색으로 다양한 조합을 탐색
- LLM judge + 규칙 기반 평가가 진화 품질을 제어
- 계층적 검증 게이트(시뮬레이션 → 제한 → A/B)로 위험 통제
- 실측 +9.0pp / +4.8pp / +30.6pp의 실제 성과
Ouroboros가 "에이전트가 스스로를 진화시킨다"는 원리를 161일 배포로 보여줬다면, LinkedIn은 **"자가진화를 기업이 어떻게 안전하게 운영하는가"**를 보여줍니다. 두 논문을 합치면 자가진화의 **이론(무엇) + 실전(어떻게)**이 완성됩니다.
핵심 요약:
- ✅ LinkedIn 실제 프로덕션에서 자가진화 고객지원 에이전트 운영
- ✅ 진화적 검색으로 프롬프트 최적화 (모델 재훈련 없이)
- ✅ 2주 A/B: QA 자가해결 +9.0pp, 라우팅 정확도 +30.6pp
- ✅ 닫힌 루프(프롬프트·검색·평가) + 운영 가드레일
- ✅ 자가진화 = 실험실 개념이 아닌 운영 원칙