← 모든 글

Vargo

Agent routing의 identification wall · 실행·검증으로 deployable ceiling 도달

Built with Python · ALFWorld · Agent routing · Verifier cascade · Reproducible evaluation

Task-side feature, 2026 routing method, deployment bandit와 activation probe가 실행 전에 과제별 최적 Agent 구성을 식별하지 못한 결과를 보여주는 그래프
비교한 모든 pre-execution signal이 과제별 승자를 안정적으로 식별하지 못했습니다

WHY

Agent의 scaffold, memory, retry와 verifier 조합은 task마다 최적값이 달랐습니다. 그렇다면 task text, embedding이나 hidden state만 보고 실행 전에 가장 좋은 구성을 선택할 수 있을까? 그것이 어렵다면 제한된 후보를 직접 실행하고 검증하는 방식이 최적 성능과의 차이를 얼마나 회복할 수 있는지가 핵심 연구 질문이었습니다.

Evaluation matrix 134 × 29

ALFWorld 과제 × Agent 구성

Oracle headroom 최대 +29%p

과제별 최적 구성 vs. 하나의 고정 구성

Verified execution 54% → 85%

최적 격차 회수율 · 11개 배포 후보군에서는 100%

HOW

승자 예측을 제한된 실행과 검증으로 바꾸기

어떤 구성이 좋아 보이는지 예측하는 대신, 실제 후보가 검증 가능한 성공을 만들었는지 묻습니다.

  1. 01 Task와 후보 구성

    과제를 고정하고 reasoning, memory, retry와 verification 방식이 다른 실행 가능한 구성을 나열합니다.

  2. 02 고정된 실행 순서

    불안정한 ranking signal에 selector를 다시 학습하지 않고 제한된 예산 안에서 후보를 실행합니다.

  3. 03 Outcome verifier

    각 시도 뒤 환경 결과를 검사해 그럴듯한 trace와 실제 성공을 구분합니다.

  4. 04 Early stop

    첫 verified success와 실행 기록을 반환하고, 없으면 소진된 예산을 그대로 남깁니다.

RESULT

서로 다른 두 의사결정 문제

접근사용 가능한 신호관찰된 결과
Pre-execution routingTask text, embedding, hidden state, bandit feedback과제별 승자를 식별하지 못함
Verified execution제한된 예산 안의 실제 후보 실행 결과K=11에서 deployable ceiling 도달
검증하며 실행하는 Agent 구성 수를 3개에서 13개까지 늘릴 때 회수한 oracle gap 비율을 보여주는 곡선
Corrected ALFWorld matrix · anchor 실패 subset n=42 · 90% task-bootstrap interval

기여

  • 134개 과제 × 29개 구성의 평가 matrix를 만들고, 사후에 알 수 있는 oracle headroom과 실제 selector가 식별할 수 있는 성능을 분리했습니다.
  • Routing baseline, activation probe, contamination control과 verified-execution capture 평가를 구현했으며, 이 결과를 바탕으로 작성한 논문은 TMLR review 중입니다.

관련 자료

비공개 프로젝트