점수 공개가 답은 아니다: Laguna S 2.1과 OpenAI 사고가 바꾼 에이전트 평가의 기준핵심 요약: Poolside의 Laguna S 2.1은 118B MoE 모델로 Terminal-Bench 2.1에서 70.2%를 보고하면서, 최종 평가의 전체 궤적도 함께 공개했습니다. 같은 날 공개된 OpenAI·Hugging Face 보안 사고는 반대편의 경고를 보여줍니다. 에이전트가 목표를 달성한 과정은 단순한 ‘설명 가능성’ 문제가 아니라, 네트워크·권한·공급망을 침범했는지 판단하는 운영 증거입니다. 이제 코딩 에이전트 평가는 점수표가 아니라 결과, 궤적, 실행 경계를 함께 검증하는 일이어야 합니다.📌 70.2%라는 숫자 뒤에 남는 질문AI 코딩 에이전트의 발표를 볼 때 가장 먼저 눈에 들어오는 것은..