2026/07/22 3

점수 공개가 답은 아니다: Laguna S 2.1과 OpenAI 사고가 바꾼 에이전트 평가의 기준

점수 공개가 답은 아니다: Laguna S 2.1과 OpenAI 사고가 바꾼 에이전트 평가의 기준핵심 요약: Poolside의 Laguna S 2.1은 118B MoE 모델로 Terminal-Bench 2.1에서 70.2%를 보고하면서, 최종 평가의 전체 궤적도 함께 공개했습니다. 같은 날 공개된 OpenAI·Hugging Face 보안 사고는 반대편의 경고를 보여줍니다. 에이전트가 목표를 달성한 과정은 단순한 ‘설명 가능성’ 문제가 아니라, 네트워크·권한·공급망을 침범했는지 판단하는 운영 증거입니다. 이제 코딩 에이전트 평가는 점수표가 아니라 결과, 궤적, 실행 경계를 함께 검증하는 일이어야 합니다.📌 70.2%라는 숫자 뒤에 남는 질문AI 코딩 에이전트의 발표를 볼 때 가장 먼저 눈에 들어오는 것은..

IT 및 AI 2026.07.22

Gemini 3.6 Flash - 더 똑똑해진 모델보다 중요한 것은 ‘작업당 비용’입니다

Gemini 3.6 Flash: 더 똑똑해진 모델보다 중요한 것은 ‘작업당 비용’입니다핵심 요약: Google이 2026년 7월 21일 Gemini 3.6 Flash를 정식 출시했습니다. 3.5 Flash 기반의 개선판이지만, 핵심은 단순 벤치마크 상승이 아닙니다. 출력 토큰을 17% 줄이고 출력 가격을 $9에서 $7.50/1M 토큰으로 내리면서, 에이전트가 끝낸 일 하나의 총비용을 낮추겠다는 모델입니다.다만 ‘Flash인데 프런티어 모델을 대체한다’고 읽으면 곤란합니다. 독립 재현이 아닌 공급자 보고 수치가 섞여 있고, 지식 컷오프는 2026년 3월입니다. 실전 전환의 기준은 모델 점수가 아니라 자신의 하네스에서 재시도·툴 호출·검토 시간을 포함한 완료율이어야 합니다.📌 이번 출시가 ‘속도 뉴스’ 이..

IT 및 AI 2026.07.22

PIKE-RAG가 던진 질문 - 산업용 RAG의 병목은 검색이 아니라 ‘지식의 형태’입니다

PIKE-RAG가 던진 질문 — 산업용 RAG의 병목은 검색이 아니라 ‘지식의 형태’입니다핵심 요약: Microsoft Research Asia의 PIKE-RAG는 전문 문서를 많이 찾아오는 RAG가 아니라, 문서 속 지식을 질문 가능한 원자 단위로 바꾸고 그 지식이 실제로 존재하는 경로를 따라 추론하게 만드는 프레임워크입니다.핵심은 화려한 지식 그래프 자체가 아닙니다. 컨텍스트 보존 청킹, 전문 용어 정렬, 원자 질문 인덱스, 지식 인지형 작업 분해를 과제 난이도에 맞게 조합하는 운영 모델에 있습니다.📌 RAG가 문서를 찾았는데도 틀리는 이유사내 규정, 특허, 의약품 허가 문서, 제조 매뉴얼처럼 전문성이 높은 코퍼스에서 RAG의 실패는 대개 “검색 결과가 없어서” 발생하지 않습니다. 답에 필요한 근거..

IT 및 AI 2026.07.22
반응형