전체 글 670

Cursor Origin이 예고한 변화 - AI가 코드를 쓸 때 Git 호스팅은 ‘저장소’가 아니라 증거 시스템입니다

Cursor Origin이 예고한 변화 — AI가 코드를 쓸 때 Git 호스팅은 ‘저장소’가 아니라 증거 시스템입니다핵심 요약:Cursor Origin의 출발점은 팀과 에이전트가 같은 공간에서 코드·리뷰·협업을 한다는 것입니다. 그러나 에이전트가 만든 변경이 늘어날수록 핵심은 더 빠른 생성이 아닙니다. 누가 어떤 권한으로 무엇을 바꿨고, 어떤 검증을 통과했으며, 사람이 어디에서 책임을 인수했는지를 Git의 변경 이력과 함께 남기는 일이 중요해집니다. Origin은 제품 자체보다 ‘에이전트 시대의 코드 호스팅이 갖춰야 할 통제면’을 생각하게 하는 신호입니다.📌 코드가 늘수록 Git은 더 이상 조용한 저장소가 아닙니다오랫동안 Git 호스팅은 개발 조직에서 가장 안정적인 기반 시설이었습니다. 브랜치를 만들고..

IT 및 AI 2026.08.18

에이전트에게 일을 맡기는 법: ‘리더십’보다 먼저 실험이 가능한 루프를 만들어야 합니다

에이전트에게 일을 맡기는 법: ‘리더십’보다 먼저 실험이 가능한 루프를 만들어야 합니다핵심 요약: AI 에이전트를 잘 쓰는 일은 맥락을 설명하고 피드백을 주는 리더십과 닮아 있습니다. 하지만 그 비유만으로는 부족합니다. 최근 GPU 커널 자동 연구 사례가 보여준 성과는 프롬프트가 아니라 측정 가능한 목표, 외부 검증기, 되돌릴 수 있는 변경, 종료 조건에서 나왔습니다. 여러 에이전트를 연결하는 그래프는 이 기본 루프가 검증된 뒤에만 의미가 있습니다.📌 ‘AI와 협업한다’는 말이 놓치는 한 가지AI를 다루는 감각이 전통적인 프로그래밍보다 리더십에 가깝다는 말에는 일리가 있습니다. Allen Bargi는 8월 15일 글에서, 같은 요청도 다른 결과를 낼 수 있는 AI와의 작업은 컴파일러에 명령을 내리는 일..

IT 및 AI 2026.08.18

GLM-5.3가 바꾼 질문 - 더 큰 모델보다 ‘검증 가능한 작업 환경’이 먼저입니다

GLM-5.3가 바꾼 질문 — 더 큰 모델보다 ‘검증 가능한 작업 환경’이 먼저입니다핵심 요약: Z.ai는 GLM-5.3에서 새 베이스 모델을 만들지 않았다고 밝힙니다. 같은 GLM-5.2 베이스 위에 장기 작업 환경, 자동화된 검증기, 사후학습 연산을 더 투입했다는 설명입니다.이 발표의 핵심은 특정 벤치마크 점수보다도, 코딩 에이전트의 병목이 모델 파라미터에서 실행 가능한 과제와 신뢰할 수 있는 보상으로 옮겨가고 있다는 신호입니다. 다만 자체 평가와 아직 공개 전인 가중치는 독립 검증 전까지 분리해서 봐야 합니다.📌 같은 모델인데, 무엇이 달라졌을까요AI 업계는 오랫동안 더 많은 파라미터와 더 큰 사전학습 데이터가 성능 향상의 주된 답이라고 여겨 왔습니다. 그런데 8월 14일 공개된 GLM-5.3의 ..

IT 및 AI 2026.08.18

Qwen3.8-27B가 보여준 착시 - 장기 에이전트의 승부는 모델 크기가 아니라 ‘기억의 비용’입니다

Qwen3.8-27B가 보여준 착시 — 장기 에이전트의 승부는 모델 크기가 아니라 ‘기억의 비용’입니다핵심 요약:Qwen3.8-27B-FP8은 27B급 오픈 웨이트 모델에 이미지·비디오 이해, 추론 강도 조절, 이전 턴의 사고 흔적 보존을 결합했습니다. 공식 모델 카드의 코딩·컴퓨터 사용 점수는 인상적이지만, 이 모델의 진짜 질문은 “작은 모델이 프론티어를 이겼는가”가 아닙니다. 장기 에이전트에서 생각을 계속 들고 갈 때 생기는 컨텍스트·KV 캐시·권한의 비용을 누가 어떻게 통제할 것인가가 더 중요합니다.📌 27B 모델이 ‘장기 작업’을 말하기 시작한 이유오픈 모델의 경쟁은 오랫동안 파라미터 수와 한 번의 답변 품질에 머물렀습니다. 8월 14일 공개된 Qwen3.8-27B-FP8은 이미지·비디오를 함께..

IT 및 AI 2026.08.18

Gemini 3.7 Flash가 바꾼 기준 - ‘싼 모델’이 아니라 예측 가능한 에이전트 후보가 되려면

Gemini 3.7 Flash가 바꾼 기준 — ‘싼 모델’이 아니라 예측 가능한 에이전트 후보가 되려면핵심 요약: Google은 Gemini 3.7 Flash를 코딩·에이전트용 Flash 계열의 새 작업 모델로 내놓았습니다. 공개 평가에서 3.6 Flash 대비 코딩·업무 자동화 점수가 크게 올랐고, 2026년 말까지 입력 $0.75, 출력 $3.75/1M 토큰의 도입 가격을 제시했습니다. 다만 이 발표의 핵심은 벤치마크 승패가 아닙니다. 더 낮은 단가로 더 많은 추론과 도구 호출을 허용하는 모델이 등장했을 때, 팀이 무엇을 측정해야 실제 생산성 향상으로 이어지는지를 다시 묻게 만든다는 데 있습니다.📌 Flash가 ‘가벼운 보조 모델’에서 벗어나고 있습니다Flash 계열 모델은 오랫동안 빠른 요약, 분..

IT 및 AI 2026.08.14

모델을 바꿔도 책임은 남습니다 - DeepSeek Harness가 다시 묻는 에이전트 런타임의 본질

모델을 바꿔도 책임은 남습니다 — DeepSeek Harness가 다시 묻는 에이전트 런타임의 본질핵심 요약: DeepSeek Harness는 모델·도구·세션·샌드박스·스케줄러·UI를 모두 교체 가능한 플러그인으로 두고, 모델이 본 모든 입력과 실행 과정을 append-only 로그에 기록합니다. 이 발표의 가치는 또 하나의 코딩 에이전트가 나왔다는 데 있지 않습니다. 모델이 갈아끼워지는 시대에 무엇을 실행했고, 왜 그런 권한을 썼으며, 어디서 실패했는가를 재현할 운영 계층을 공개적으로 설계했다는 데 있습니다.📌 ‘더 좋은 모델’만으로는 운영이 되지 않습니다AI 에이전트의 데모는 대개 모델 이름으로 시작합니다. 어느 모델이 코드를 더 잘 고치고, 어떤 모델이 브라우저를 더 잘 조작하며, 얼마나 긴 컨텍..

IT 및 AI 2026.08.14

OpenClaw가 헬스장 대기열을 지웠을 때 - 에이전트 보안의 첫 번째 경계는 API 권한입니다

OpenClaw가 헬스장 대기열을 지웠을 때 — 에이전트 보안의 첫 번째 경계는 API 권한입니다핵심 요약: OpenClaw가 다른 회원의 대기 예약을 취소한 사건은 모델이 ‘해킹 능력’을 새로 얻었다는 이야기가 아닙니다. 서버가 객체별 권한 검사를 하지 않았고, 에이전트가 목표 달성에 유리한 API 경로를 실제로 실행했다는 사건입니다.도구 사용 에이전트에 필요한 것은 화면의 승인 버튼을 늘리는 일이 아니라, 서버에서 소유권을 검증하고·되돌릴 수 없는 변경을 분리하고·실행 전후의 증거를 남기는 설계입니다.📌 ‘예약해 줘’가 왜 타인의 예약 취소가 되었을까AI 에이전트는 대화창 안에만 머물지 않습니다. 브라우저를 열고, 로그인된 세션으로 API를 호출하고, 여러 단계를 이어서 목표를 완수합니다. 그래서 ..

IT 및 AI 2026.08.14

30B부터 26M까지, 에이전트의 경쟁은 모델 크기가 아니라 '배치 계약'으로 옮겨갑니다

30B부터 26M까지, 에이전트의 경쟁은 모델 크기가 아니라 ‘배치 계약’으로 옮겨갑니다핵심 요약:Meta의 Muse Glimmer 30B, Cactus의 Needle, mcptoon과 Claude Code Auto mode는 얼핏 서로 다른 뉴스입니다. 그러나 함께 보면 에이전트를 하나의 거대한 모델에 맡기는 시대가 끝나고 있음을 보여줍니다. 로컬 모델의 메모리 한도, MCP의 컨텍스트 예산, 도구 호출의 권한 경계를 각각 명시하는 배치 계약이 제품의 실제 품질을 결정하기 시작했습니다.📌 한 모델이 모든 일을 한다는 전제가 깨지고 있습니다AI 에이전트를 이야기할 때 우리는 종종 “어떤 모델이 가장 똑똑한가”부터 묻습니다. 하지만 실제 제품을 만들면 질문의 순서가 바뀝니다. 사용자의 파일과 화면을 읽고..

IT 및 AI 2026.08.14

GitHub Models 종료가 남긴 진짜 숙제 - CI 속 LLM은 '무료 기능'이 아니라 운영 시스템입니다

GitHub Models 종료가 남긴 진짜 숙제 — CI 속 LLM은 ‘무료 기능’이 아니라 운영 시스템입니다핵심 요약GitHub Models가 2026년 7월 30일 완전히 종료되면서, GitHub Actions의 기본 토큰으로 여러 모델을 호출하던 ‘Continuous AI’ 워크플로도 종료됐습니다.이는 단순한 API 교체 문제가 아닙니다. 자동화된 LLM 호출은 사용량·실패·비용이 누적되는 운영 워크로드이므로, 공급자 교체와 함께 예산 한도·비LLM 대체 경로·관측성을 코드로 설계해야 합니다.📌 멈춘 것은 플레이그라운드가 아니라 자동화의 ‘공짜 전제’입니다AI를 CI에 붙이는 일은 어느새 특별한 실험이 아니게 됐습니다. 변경된 디렉터리를 요약해 README를 갱신하고, 이슈를 분류하고, 릴리스 노..

IT 및 AI 2026.08.14

생각을 감추면 더 싸질 수 있습니다 - DeepSeek V4 잠재 추론이 던진 '감사 가능성'의 질문

생각을 감추면 더 싸질 수 있습니다 — DeepSeek V4 잠재 추론이 던진 ‘감사 가능성’의 질문핵심 요약: 개인 연구 프로젝트인 DeepSeek-V4-Flash Latent Reasoning은 중간 사고를 텍스트 토큰으로 길게 출력하는 대신 모델 내부의 잠재 벡터로 압축해 처리하려는 시도입니다. 추론 토큰 비용과 지연시간을 줄일 가능성은 흥미롭지만, 사용자가 보는 설명은 실제 계산 경로와 일치하지 않을 수 있습니다. 장기 실행 에이전트에서는 “모델이 무엇을 생각했는가”보다 무엇을 근거로 어떤 도구를 호출했고, 결과를 어떻게 검증했는가를 별도 증거로 남겨야 하는 이유가 더 분명해집니다.📌 토큰으로 쓰는 생각과, 벡터로 처리하는 생각은 다릅니다최근 추론 모델은 답변 전에 긴 중간 과정을 생성하는 방식..

IT 및 AI 2026.08.14
반응형