AI 에이전트 지속 학습 전략: 프로덕션 실행 기록과 힌트로 모델을 증류하는 네 가지 조합 정리
AI 엔지니어 콘퍼런스의 지속 학습 발표를 정리했다. 기업이 이미 쌓아둔 서비스 실행 기록과 힌트를 조합해 에이전트 행동을 교정하는 증류 전략, SWE-bench 실험 수치, 그리고 현장에서 검증된 요령까지 함께 살펴본다.
핵심 내용 읽기 →AI TOPIC
SWE-bench 관련 핵심 뉴스와 활용 인사이트 7편을 최신순으로 모았습니다.

AI 엔지니어 콘퍼런스의 지속 학습 발표를 정리했다. 기업이 이미 쌓아둔 서비스 실행 기록과 힌트를 조합해 에이전트 행동을 교정하는 증류 전략, SWE-bench 실험 수치, 그리고 현장에서 검증된 요령까지 함께 살펴본다.
핵심 내용 읽기 →
서울대 DSBA 연구실 세미나를 바탕으로 코딩 에이전트를 채점하는 SWE-bench·Terminal-Bench·RExBench의 설계와 한계, 벤치마크가 1년도 못 버티고 포화되는 이유, 그리고 모델과 실행 하네스를 분리해 측정해야 하는 까닭을 정리했다.
핵심 내용 읽기 →
사카나 AI와 브리티시컬럼비아대가 제안한 다윈 괴델 머신은 코딩 에이전트가 자기 코드를 직접 고쳐 세대를 이어가는 구조다. 수학적 증명 대신 진화적 실험으로 개선을 검증해 벤치마크 점수를 두 배 이상 끌어올렸다.
핵심 내용 읽기 →
SWE-bench를 만든 존 양이 새 벤치마크 프로그램벤치를 내놨다. 구현 과정 대신 완성된 실행 파일만 평가하는 설계, 출시 당시 0%였던 성적, 인터넷을 열었을 때 드러난 보상 해킹 문제까지 인터뷰에서 짚은 내용을 정리했다.
핵심 내용 읽기 →
AI 코딩 모델의 평가 기준이 깔끔한 함수 작성에서 실제 깃허브 저장소의 이슈 해결로 옮겨간 과정을, SWE-bench의 구성과 검증판이 따로 필요했던 이유, 그리고 점수 포화와 학습 데이터 오염 문제까지 짚어 정리했습니다.
핵심 내용 읽기 →
실제 시니어 엔지니어의 PR을 바탕으로 저사양 지시문과 검증 에이전트를 결합해 코딩 AI를 평가하는 Snorkel AI의 Senior SWE-Bench가 어떻게 설계됐고, 리더보드에서 무엇이 드러났는지 정리한다.
핵심 내용 읽기 →
스탠퍼드 CME295 강의를 바탕으로 LLM 평가법을 정리한다. 사람 평가와 규칙 기반 지표의 한계, LLM-as-a-Judge와 편향, MMLU·SWE-bench 등 벤치마크와 데이터 오염 문제를 다룬다.
핵심 내용 읽기 →