LLM 벤치마크보다 중요한 것 — 에이전트가 도구를 제대로 쓰는가
EVA-Bench Data 2.0 같은 도구 사용 평가 흐름을 바탕으로, AI 에이전트 평가는 단순 정답률보다 작업 완료, 실패 복구, 비용, 권한 경계를 봐야 한다는 점을 정리한다.
개인적인 일상과 소프트웨어 내용을 포스팅합니다.
EVA-Bench Data 2.0 같은 도구 사용 평가 흐름을 바탕으로, AI 에이전트 평가는 단순 정답률보다 작업 완료, 실패 복구, 비용, 권한 경계를 봐야 한다는 점을 정리한다.
Codex, GitHub Agent Tasks, hf CLI, Vercel Sandbox 흐름을 통해 개발 도구가 사람 중심 UI에서 에이전트가 안정적으로 조작할 수 있는 CLI/API 중심으로 재편되는 이유를 정리한다.
LLM 앱은 출시 직후보다 사용량이 늘어난 뒤 비용 구조가 먼저 터진다. 캐싱, 모델 라우팅, 컨텍스트 절약, 배치 처리, 관측성으로 비용을 낮추는 실전 설계 원칙을 정리한다.
Vercel Sandbox Persistence GA는 AI 에이전트 실행 환경이 휘발성 샌드박스에서 상태를 유지하는 개발 런타임으로 이동하고 있음을 보여준다.
Jira를 AI 에이전트의 업무 인터페이스로 쓰는 방식은 유용하지만 만능은 아니다. 댓글 과다, 상태 전환 실수, 민감정보 노출, 템플릿 피로감 등 운영하면서 마주칠 문제와 개선 방향을 정리한다.
AI 에이전트가 매번 처음부터 추론하지 않게 하려면 과거 Jira Issue를 검색해야 한다. 유사 이슈, 결정 사항, 실패 로그, 해결 패턴을 활용하는 /jira similar 인터페이스를 정리한다.