← 전체 프로젝트
AGENTS / EVALUATION2026

에이전트
최적화

실행 기록의 지식화와 평가 기반 워크플로우 개선

자체 AI 제품 / CPO

프로젝트 기록

HotpotQA 데모 · 원본 평가 수치를 유지한 UI 재구성
HotpotQA 데모 · 원본 평가 수치를 유지한 UI 재구성

문제의 배경과
직접 맡은 일.

배경

  • 프롬프트·스킬 수정 후에도 세션이 바뀌면 같은 실패 반복
  • 원인 분석과 수정은 개발자에게 남고, 개선 지식은 과제별 분산
  • 기억을 늘릴수록 중복 지시·상충 지시·검색 노이즈 누적
  • 성능과 함께 토큰 비용·운영 복잡도를 고려한 최적화 필요

목적

  • 실행의 성공·실패 원인을 다음 과제에서 재사용
  • 평가로 확인한 개선만 워크플로우에 반영

담당 역할

  • CPO / 제품 방향·평가 기준·실험 설계
  • 코드 구현·실험 실행·결과 분석과 우선순위 판단에 기여

해결 방법과
시스템 구조.

세 개의 레이어가 연결된 학습·최적화 시스템세션 경험 → 구조화된 지식 → 맥락별 실행 → 평가로 확인한 개선세 개의 레이어가 연결된 학습·최적화 시스템세션 경험 → 구조화된 지식 → 맥락별 실행 → 평가로 확인한 개선LAYER 01 / 세션 기반 지식 생성LAYER 02 / 지식 큐레이션공유 지식 기반LAYER 03 / 평가 기반 최적화에이전트 세션 — 시도 / 오류 / 피드백에이전트 세션시도 / 오류 / 피드백추출·구조화 — 실행 기록 → 재사용 지식추출·구조화실행 기록 → 재사용 지식스킬·전략 — 재사용 조건 + 실행 지침스킬·전략재사용 조건 + 실행 지침과제·프로젝트 맥락 — 관련 지식 검색 / 지식 간 관계 추론과제·프로젝트 맥락관련 지식 검색지식 간 관계 추론과제별 실행 계획 — Workflow → Step → Skill / 맥락별 실행 가이드과제별 실행 계획Workflow → Step → Skill맥락별 실행 가이드Knowledge Graph DB — 스킬 / 전략 / 실행 궤적Knowledge Graph DB스킬 / 전략 / 실행 궤적신규 구축 / 기존 개선 — PRD + 데이터 + 워크플로우신규 구축 / 기존 개선PRD + 데이터 + 워크플로우평가 → 개선 — 프롬프트 / 코드 / 오케스트레이션평가 → 개선프롬프트 / 코드 / 오케스트레이션검증·메타 학습 — 유지 / 복구 / 일반화검증·메타 학습유지 / 복구 / 일반화실행의 성공·실패와 평가 피드백을 다음 과제의 지식으로 재사용
처리·데이터 전달반복·피드백서비스·환경 경계
01

평가로 확인한 변경만 반영

평가 데이터와 지표를 고정한 뒤 워크플로우 수정. 동일 조건에서 성능 향상·회귀를 비교하고 변경 유지 또는 복구.

02

다음 과제에서 재사용할 지식

온라인 지식 생성과 오프라인 최적화의 연결. 성공·실패의 이유를 공유 지식에 반영해 다음 과제에서 재사용.

최적화 실행 작업 화면 · 데모 기반 UI 재구성

결과와 산출물.

76.55내부 평가 종합 점수
+23.88Baseline 대비 점수
4평가 과제

내부 워크플로우 평가

Baseline
52.67
MIPROv2
59.71
TextGrad
61.08
Feedback Descent
66.56
GEPA
69.52
직접 참여한 최적화 플랫폼
76.55

2026.05 내부 평가 · HotpotQA·IFBench·HoVer·PUPA의 동일 조건 팀 단위 결과. 위 HotpotQA 데모 화면과 별도의 평가 범위.

NEXT PROJECT / 02AI 영양사