Vargo
Agent routing의 identification wall · 실행·검증으로 deployable ceiling 도달
Agent Evaluation · Decision Science
Built with Python · ALFWorld · Agent routing · Verifier cascade · Reproducible evaluation
WHY
Agent의 scaffold, memory, retry와 verifier 조합은 task마다 최적값이 달랐습니다. 그렇다면 task text, embedding이나 hidden state만 보고 실행 전에 가장 좋은 구성을 선택할 수 있을까? 그것이 어렵다면 제한된 후보를 직접 실행하고 검증하는 방식이 최적 성능과의 차이를 얼마나 회복할 수 있는지가 핵심 연구 질문이었습니다.
Evaluation matrix 134 × 29
ALFWorld 과제 × Agent 구성
Oracle headroom 최대 +29%p
과제별 최적 구성 vs. 하나의 고정 구성
Verified execution 54% → 85%
최적 격차 회수율 · 11개 배포 후보군에서는 100%
HOW
승자 예측을 제한된 실행과 검증으로 바꾸기
어떤 구성이 좋아 보이는지 예측하는 대신, 실제 후보가 검증 가능한 성공을 만들었는지 묻습니다.
- 01 Task와 후보 구성
과제를 고정하고 reasoning, memory, retry와 verification 방식이 다른 실행 가능한 구성을 나열합니다.
- 02 고정된 실행 순서
불안정한 ranking signal에 selector를 다시 학습하지 않고 제한된 예산 안에서 후보를 실행합니다.
- 03 Outcome verifier
각 시도 뒤 환경 결과를 검사해 그럴듯한 trace와 실제 성공을 구분합니다.
- 04 Early stop
첫 verified success와 실행 기록을 반환하고, 없으면 소진된 예산을 그대로 남깁니다.
RESULT
서로 다른 두 의사결정 문제
| 접근 | 사용 가능한 신호 | 관찰된 결과 |
|---|---|---|
| Pre-execution routing | Task text, embedding, hidden state, bandit feedback | 과제별 승자를 식별하지 못함 |
| Verified execution | 제한된 예산 안의 실제 후보 실행 결과 | K=11에서 deployable ceiling 도달 |
기여
- 134개 과제 × 29개 구성의 평가 matrix를 만들고, 사후에 알 수 있는 oracle headroom과 실제 selector가 식별할 수 있는 성능을 분리했습니다.
- Routing baseline, activation probe, contamination control과 verified-execution capture 평가를 구현했으며, 이 결과를 바탕으로 작성한 논문은 TMLR review 중입니다.
관련 자료
비공개 프로젝트