HotpotQA 데모 · 원본 평가 수치를 유지한 UI 재구성
01 / CONTEXT & CONTRIBUTION
문제의 배경과
직접 맡은 일.
배경
- 프롬프트·스킬 수정 후에도 세션이 바뀌면 같은 실패 반복
- 원인 분석과 수정은 개발자에게 남고, 개선 지식은 과제별 분산
- 기억을 늘릴수록 중복 지시·상충 지시·검색 노이즈 누적
- 성능과 함께 토큰 비용·운영 복잡도를 고려한 최적화 필요
목적
- 실행의 성공·실패 원인을 다음 과제에서 재사용
- 평가로 확인한 개선만 워크플로우에 반영
담당 역할
- CPO / 제품 방향·평가 기준·실험 설계
- 코드 구현·실험 실행·결과 분석과 우선순위 판단에 기여
02 / SYSTEM DESIGN
해결 방법과
시스템 구조.
처리·데이터 전달반복·피드백서비스·환경 경계
01평가로 확인한 변경만 반영
평가 데이터와 지표를 고정한 뒤 워크플로우 수정. 동일 조건에서 성능 향상·회귀를 비교하고 변경 유지 또는 복구.
02다음 과제에서 재사용할 지식
온라인 지식 생성과 오프라인 최적화의 연결. 성공·실패의 이유를 공유 지식에 반영해 다음 과제에서 재사용.
최적화 실행 작업 화면 · 데모 기반 UI 재구성03 / RESULTS & SCOPE
결과와 산출물.
76.55내부 평가 종합 점수
+23.88Baseline 대비 점수
4평가 과제
2026.05 내부 평가 · HotpotQA·IFBench·HoVer·PUPA의 동일 조건 팀 단위 결과. 위 HotpotQA 데모 화면과 별도의 평가 범위.
NEXT PROJECT / 02AI 영양사↗