# Agent Stack Radar — 전체 신호 신호 96건. 판정은 채택/주시/실험/회피/무시, 날짜는 이벤트 발생일 기준. 인용 시 각 기사 URL을 출처로 표기해 주세요. --- ## 접근은 막혔지만 구조는 바뀌었다 — Fable 5·Mythos 5가 에이전트 빌더에게 주는 전망 - URL: https://stkradar.com/articles/fable5-mythos5-outlook-deep-dive/ - 판정: 주시 (영향도 88/100) - 이벤트: 2026-06-18 - 분류: 프레임워크 · Anthropic - 출처: 4개 (주근거 1) - 토픽: Anthropic (https://stkradar.com/topics/anthropic/) Claude Fable 5와 Mythos 5는 2026-06-09 출시됐지만 사흘 만에 수출규제로 전 세계 접근이 중단됐다. 그럼에도 에이전트를 만드는 사람이라면 주목해야 할 이유가 있다 — 이 두 모델은 Anthropic이 처음 공개하는 Mythos 클래스이며, Fable 5의 자율 코딩 성능과 가드레일 구조는 접근이 재개되는 즉시 작업 방식을 바꿀 것이기 때문이다. 2026-06-18 현재 두 모델 모두 여전히 이용 불가 상태다. Fable 5는 '안전하게 일반 공개할 수 있는 Mythos 클래스 모델'로 설계됐다. 이름부터 의도가 읽힌다 — Fable은 라틴어 fabula(이야기)에서, Mythos는 그리스어 mythos에서 왔으며 두 단어는 어원이 같다. 둘을 다른 이름으로 부르는 이유는 가드레일이 다르기 때문이다. ## Mythos 클래스란 무엇인가 - Mythos는 Opus **위에 추가된 새 상위 티어**. 첫 모델 **Mythos Preview가 2026년 4월 출시**됨 - Mythos 5(6/9 제한 프리뷰)가 그 위쪽 계열의 최신 모델 - Mythos 5 = 사이버보안·생물학·헬스케어 분야 벤치마크 최상위. **BioMysteryBench 46.1%**(Opus 4.8 40.0%) - 현재는 Glasswing 파트너(6/2 기준 약 150개 기관·15개국)에게만 가드레일 해제 버전 제공 ## Fable 5 성능 — 에이전트 빌더에게 중요한 숫자 - **SWE-Bench Pro: 80.3%** (Opus 4.8 69.2%, GPT-5.5 58.6%) - **FrontierCode Diamond(자율 패치): 29.3%** vs Opus 4.8 13.4%, GPT-5.5 5.7% - Stripe 실증: 5000만 줄 루비 코드베이스 마이그레이션을 **하루** 만에 처리(팀 전체 2개월치 작업) - 적응형 사고가 항상 켜진 유일한 모드. 사고 깊이는 effort 5단계(low/medium/high/xhigh/max)로만 제어 ## 가드레일의 실제 동작 방식 - 사이버보안·생물·화학 관련 쿼리 → 조용히 **Opus 4.8으로 라우팅**(응답하되 Fable 5가 아닌 모델이 처리) - Anthropic 표현: "보수적으로 튜닝했기 때문에 가끔 정상 쿼리도 걸릴 수 있음" - 즉, 에이전트가 특정 도구를 호출할 때 의도치 않게 더 약한 모델이 응답할 수 있음 — 파이프라인 설계 시 고려 필요 ## 가격·스펙 - 입력 **$10/M** · 출력 **$50/M** — Opus 4.8($5/$25) 정확히 두 배 - 컨텍스트 창: 1M 토큰. 최대 출력: 128k 토큰(Opus 4.8 동일) - API·도구 사용 패턴은 Opus 4.8과 호환. 단, thinking 파라미터 비활성화 불가 ## 수출규제 — 지금 상황 - 6/12 수출규제로 전 세계 외국인 접근 즉시 중단(기존 단신 참조). **6/18 현재 여전히 이용 불가** - Anthropic 공식 페이지에 "currently unavailable" 배너 유지 중 - 복구 시점: "가능한 한 빨리" 외 구체 일정 없음 - 외국인 범위: 미국 내·외 불문, Anthropic 외국인 직원 포함 ## 에이전트를 만드는 사람에게 주는 함의 - **지금 할 수 있는 준비**: Fable 5 API 구조는 Opus 4.8과 동일. 마이그레이션 비용 낮음 — 접근 재개 시 즉시 전환 가능 - **effort 파라미터**: 자율 작업 파이프라인 비용 제어의 핵심 레버. medium부터 시작해 올리는 방식 권장 - **가드레일 라우팅**: 민감 도메인 쿼리를 포함하는 에이전트는 실제로 어떤 모델이 응답하는지 로그로 확인 필요 - **규제 리스크**: 단일 모델·단일 제공사 의존 구조는 이번 사례로 실제 서비스 중단 리스크 확인. 대체 경로를 설계 단계에서 반영할 것 - **Mythos 5**: Glasswing 파트너십 신청이 사이버보안·생물 분야 팀의 유일한 접근 경로 핵심 요약: - Mythos 클래스 — Opus 위의 새 티어. 첫 모델 Mythos Preview(4월), 이어 Mythos 5(6/9 제한 프리뷰, 소수 Glasswing 파트너 전용) 순으로 등장 - Fable 5 = Mythos 5와 동일 베이스 모델 + 가드레일. 일반 공개용으로 설계됨. 사이버보안·생물·화학 관련 쿼리는 Opus 4.8으로 조용히 라우팅 - 가격: 입력 $10/M, 출력 $50/M — Opus 4.8($5/$25) 대비 두 배. 컨텍스트 1M 토큰·최대 출력 128k 동일 - 2026-06-12 미 정부 수출규제 지시로 전 세계 외국인 접근 즉시 중단(Anthropic 지시 수령 17:21 ET). 6/18 현재 복구 미정 추천: Fable 5 접근이 재개될 때를 대비해 지금 마이그레이션 경로를 파악해둘 것(API·파라미터 구조는 Opus 4.8과 동일). effort 파라미터 조절로 비용 제어가 가능한 구조이므로, 자율 작업 파이프라인에 Fable 5를 넣으려면 effort=medium부터 시작해 증분 테스트 권장. Mythos 5는 Glasswing 파트너십 외 경로 없음 — 사이버보안·생물 분야 팀은 파트너십 신청 고려. 단일 제공사·단일 모델 의존은 이번 규제 사례로 리스크 확인됨. 출처 목록: - (주근거) Claude Fable 5 and Claude Mythos 5 — https://www.anthropic.com/news/claude-fable-5-mythos-5 - (변경확인) Statement on the US government directive to suspend access to Fable 5 and Mythos 5 — https://www.anthropic.com/news/fable-mythos-access - (보조근거) Introducing Claude Fable 5 and Claude Mythos 5 — Claude API Docs — https://platform.claude.com/docs/en/about-claude/models/introducing-claude-fable-5-and-claude-mythos-5 - (보조근거) Claude Fable 5 and Mythos 5 Benchmarks Explained — https://www.vellum.ai/blog/claude-fable-5-and-mythos-5-benchmarks-explained --- ## 출시 사흘 만에 전 세계에서 꺼졌다 — 미 정부가 Claude Fable 5·Mythos 5를 수출규제로 중단시킴 - URL: https://stkradar.com/articles/fable5-mythos5-us-export-suspension/ - 판정: 주시 (영향도 86/100) - 이벤트: 2026-06-12 - 분류: 프레임워크 · Anthropic - 출처: 2개 (주근거 1) - 토픽: Anthropic (https://stkradar.com/topics/anthropic/) 2026-06-12, 미 정부가 국가안보 권한을 들어 Claude Fable 5·Mythos 5 두 모델에 대한 모든 외국인의 접근을 중단하라는 수출규제 지시를 발령함. Anthropic은 해당일 오후 5시 21분(ET) 지시를 받았고, 준수 위해 전 세계 모든 고객 대상으로 두 모델을 즉시 차단함. 다른 Anthropic 모델은 영향 없음. 핵심 요약: - 미 정부가 Fable 5·Mythos 5 접근을 모든 외국인(미국 안팎·Anthropic 외국인 직원 포함)에게 금지하는 수출규제 지시 발령 - Anthropic, 준수 위해 두 모델을 전 세계 전체 고객 대상으로 즉시 비활성화 - 나머지 Anthropic 모델 접근은 영향받지 않음 - 출시 페이지에 6/12자 '접근 불가' 공지 배너 게시 추천: Fable 5·Mythos 5에 직접 의존하던 구성은 즉시 대체 모델 경로를 확보해야 함. 단일 모델·단일 제공사 고정을 피하고 동급 모델로 갈아탈 여지를 평가 단계에서 미리 마련할 것. 복구 시점은 공표된 바 없으므로 일정 가정 금지. [추정] 소프트웨어 접근 수준 규제가 선례로 남으면 외국인 팀 구성·해외 배포에 규제 점검이 상시 변수로 들어올 수 있음. 출처 목록: - (주근거) Statement on the US government directive to suspend access to Fable 5 and Mythos 5 — https://www.anthropic.com/news/fable-mythos-access - (변경확인) Claude Fable 5 and Claude Mythos 5 (6/12 접근 불가 공지 배너) — https://www.anthropic.com/news/claude-fable-5-mythos-5 --- ## Fable 5엔 thinking budget을 손으로 못 준다 — 새 최상위 모델에서 프롬프트가 바뀐 지점 - URL: https://stkradar.com/articles/fable5-prompting-effort-adaptive-thinking/ - 판정: 주시 (영향도 79/100) - 이벤트: 2026-06-09 - 분류: SDK · Fable 5 - 출처: 4개 (주근거 1) Anthropic이 6월 9일 GA한 최상위 모델 claude-fable-5는 프롬프트 작성 방식을 바꿈. thinking 예산을 손으로 못 주고(적응형 사고가 항상 켜진 유일한 모드), 사고 깊이는 effort 다섯 단계로만 조절함. 지시는 길게 나열하기보다 한 줄로 주는 편이 결과가 좋음. 핵심 요약: - 사고량 조절이 effort 하나로 모임 — low/medium/high/xhigh/max 다섯 단계, 기본값 high. 끄기('off') 단계는 없음. - 적응형 사고가 항상 켜진 유일한 모드라 thinking 파라미터를 비우면 됨. thinking:{type:"disabled"} 는 거부됨(Fable 5·Mythos 5·Mythos Preview 공통), 수동 budget_tokens 도 안 받음. - thinking.display 기본값이 "omitted"(사고 칸 빔)라, 읽을 요약은 display:"summarized" 를 직접 켜야 받음. 원본 사고는 미반환. - 규칙 나열보다 짧은 지시 한 줄이 잘 먹음. 옛 모델용 깐깐한 프롬프트·스킬은 품질을 떨어뜨릴 수 있어 손봐야 함. 추천: effort 는 high(기본)에서 시작, 가장 어려운 작업만 xhigh, 가벼운 작업은 medium/low. thinking 은 비우되 요약이 필요하면 display:"summarized" 만 켬. 규칙 나열 말고 의도를 한 줄로 줄 것. '추론을 응답에 그대로 옮겨라'는 금지, 필요하면 thinking 블록을 직접 읽음. 고effort에서 길어지면 '결론부터, 짧게'를 덧붙임. send_to_user 류 도구는 정의만으론 거의 안 불리니 호출 지시를 함께 줌. 긴 자율 실행에 맞춰 타임아웃·스트리밍을 미리 늘림. 출처 목록: - (주근거) Prompting Claude Fable 5 — https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-fable-5 - (보조근거) Adaptive thinking — https://platform.claude.com/docs/en/build-with-claude/adaptive-thinking - (보조근거) Effort — https://platform.claude.com/docs/en/build-with-claude/effort - (변경확인) Introducing Claude Fable 5 and Claude Mythos 5 — https://www.anthropic.com/news/claude-fable-5-mythos-5 --- ## 무료 체험이었는데 $1,081 청구서가 왔다 - URL: https://stkradar.com/articles/surprise-1081-bill-usage-billing-shift/ - 판정: 채택 (영향도 84/100) - 이벤트: 2026-06-09 - 분류: 프레임워크 · Blacksmith - 출처: 3개 (주근거 1) CI 서비스 Blacksmith가 무료 체험 사용자에게 1,081.45달러를 청구했다. 한도 초과 시 작업을 멈추는 대신 공시 요율로 과금을 누적하는 정책이 원인이다. 같은 주 Cursor의 Bugbot 사용량 과금 전환과 겹쳐, 에이전트 도구 비용이 사용량 청구로 이동하는 신호로 읽힌다. 에이전트와 CI처럼 스스로 반복 실행되는 도구는 쓰는 동안 미터기가 도는 택시에 가깝다. 이번 사례는 그 미터기가 있는 줄도 몰랐던 사용자가 받은 청구서다. ## 무슨 일이 있었나 - GitHub Actions가 느리고 비싸 **Blacksmith**를 도입 — "더 빠르고 더 싸다"는 YC 스타트업, "**무료 체험·신용카드 불필요**" 조건. 실제로 더 빨랐음 - "무료 분량 **80% 소진**, 중단을 피하려면 카드를 등록하세요" 메일 수신 → 한도가 차면 작업이 멈출 것으로 가정하고 계속 사용 - **2주 뒤** "이번 달 500.60달러 지출" 알림 → **다시 2주 뒤** 청구서 → **이틀 뒤** 연체 통지 (총 **1,081.45달러**) - 지원팀 해명: 메일의 "중단(disruption)"은 서비스 정지가 아니라 **계정 검토 표시**라는 의미였음 — 한도를 넘겨도 작업은 계속 돌고, 요금도 계속 쌓임 - 글쓴이가 확인한 약관에는 "한도 도달 시 작업 중단" 문구가 없음. "무료 체험 = 큰돈 나갈 일 없음"은 전부 사용자 쪽 가정이었음 ## 쟁점 — 이런 청구가 정당한가 - 글쓴이가 확인한 **06-08 기준 약관**은 결제 정보 제공을 전제로 청구 권리를 서술 — 다만 무료 체험 중 초과분에 결제 의무를 두는 것 자체는 SaaS 약관에서 가능한 방식 - 통념과의 충돌: 카드 없이 시작한 무료 체험은 한도에 도달하면 멈추는 **하드 캡**으로 기대하는 사용자가 대부분 — 글쓴이는 이런 과금을 예상할 사용자가 **5% 미만**이라고 봄 - 카드가 없는 사용자를 초과 사용 상태로 방치했다가 나중에 연체 청구서를 보내는 운영은, 법적 정당성과 별개로 신뢰를 깎는 방식이라는 지적 ## 왜 한 회사의 사고가 아닌가 - 같은 주(**06-08**) Cursor가 코드 리뷰 에이전트 Bugbot을 갱신 고객부터 **사용량 과금으로 전환** - 구조적인 이유: 에이전트는 계획, 수정, 테스트, **재시도**를 반복함 — 공급자의 실제 원가는 요청 1회가 아니라 **결과 하나까지의 총 토큰**이라 좌석 정액으로는 감당이 어려움 - 좌석당 정액에 비용이 흡수되던 시대가 끝나고, 사용량이 청구서에 그대로 드러나는 구조로 이동 중 ## 시사점 - 도구 도입 비교표에 성능 옆 **결과당 총비용** 항목이 필요함 — 데모는 1회 실행 비용만 보여줌 - "한도 초과 시 동작"이 중단인지 누적인지 확인되지 않은 도구가 지금 가장 큰 비용 위험 지점 - 자동으로 반복 실행되는 도구는 사람이 보지 않는 동안에도 비용을 만든다 — 작업 단위 비용 기록 없이는 다음 분기 예산도 설명할 수 없음 - 무료 체험을 운영하는 쪽에도 같은 교훈 — 한도 초과 시 동작을 명시하지 않으면 초기 성장이 곧 신뢰 사고로 돌아옴 핵심 요약: - Blacksmith는 무료 체험 한도를 넘긴 사용자에게 작업 중단 대신 공시 요율 누적을 적용해 1,081.45달러를 청구했다. - 약관에는 한도 도달 시 작업이 멈춘다는 문구가 없었고, 무료 체험이라 큰 비용이 없다는 기대는 사용자 쪽 가정이었다. - 같은 주 Cursor가 Bugbot을 좌석 구독에서 사용량 과금으로 전환해, 일한 만큼 청구하는 방향이 업계 흐름으로 확인됐다. 추천: 사용 중인 도구마다 한도 초과 시 동작이 중단인지 과금 누적인지 확인해 표로 정리하라. 작업 종류와 재시도 횟수, 결과를 한 장부에 기록하는 비용 회계가 출발점이다. 출처 목록: - (주근거) Surprise, pay $1000 — https://forestwalk.ai/blog/surprise-blacksmith-costs/ - (보조근거) May 2026 Bugbot Changes — https://cursor.com/blog/may-2026-bugbot-changes - (커뮤니티신호) Surprise, pay $1000 — Hacker News 토론 — https://news.ycombinator.com/item?id=48468370 --- ## Claude Code를 만든 사람은 더 이상 프롬프트를 치지 않는다 - URL: https://stkradar.com/articles/claude-code-head-writes-loops/ - 판정: 주시 (영향도 81/100) - 이벤트: 2026-06-08 - 분류: 프레임워크 · Claude Code - 출처: 5개 (주근거 1) Claude Code를 이끄는 Anthropic의 Boris Cherny가 "이제 Claude에 프롬프트를 치지 않는다. 내 일은 루프를 쓰는 것"이라고 말했다. 이틀 뒤 Google의 Addy Osmani가 이 흐름에 '루프 엔지니어링'이라는 이름을 붙였다. 프롬프트 대신, 에이전트를 굴리는 바깥 루프를 설계하는 일이 새 작업 단위로 떠오르고 있다. 프롬프트 창은 운전대였다. 루프 엔지니어링은 운전대에서 손을 떼는 게 아니라, 차가 스스로 다닐 노선도를 그리는 일로 운전자의 자리를 옮기는 것이다. ## 무슨 일이 있었나 - **06-06** Claude Code를 이끄는 Anthropic의 **Boris Cherny** 발언이 X에서 확산 — "이제 Claude에 프롬프트를 치지 않는다. Claude를 찌르고 다음 할 일을 정하는 루프들이 돌고 있다. **내 일은 루프를 쓰는 것**" - **06-07** Peter Steinberger가 이어받음 — "코딩 에이전트에 프롬프트를 칠 게 아니라, **에이전트에 프롬프트를 넣는 루프를 설계해야 한다**" - **06-08**(한국시간) Google 엔지니어 **Addy Osmani**가 이 패턴에 **루프 엔지니어링(loop engineering)** 이라는 이름을 붙인 글 발행 — 발언 연쇄가 도구 사용법 논쟁으로 번짐 - The New Stack은 06-10 기사에서 이 흐름을 "이번 주 AI 개발 도구 동네에서 가장 빠르게 움직인 대화"로 정리 ## 루프는 예약 작업과 무엇이 다른가 - 루프 = 일을 **찾고**, 나눠주고, **검사하고**, 기록하고, 다음 일을 **정하는** 작은 시스템. 사람이 에이전트를 찌르는 대신 이 시스템이 찌름 - 예약 작업(cron)은 고정된 스크립트를 돌림 — 루프는 가운데에 모델이 있어 **현재 상태를 읽고 다음 행동을 고름** - 1년 전에는 이런 루프를 직접 셸 스크립트 더미로 짜서 평생 유지보수해야 했음 — 지금은 부품이 제품 안에 들어옴 ## 부품 6개는 이미 제품 안에 있다 Osmani가 정리한 루프의 부품. Codex와 Claude Code 양쪽에 거의 같은 형태로 존재함: - **예약 실행** — 정해진 시간에 스스로 일을 찾고 분류 (Codex Automations 탭 / Claude Code 예약 작업·`/loop`·훅) - **워크트리** — 병렬로 일하는 에이전트끼리 서로 밟지 않게 격리 (`git worktree`) - **스킬** — 에이전트가 추측할 프로젝트 지식을 `SKILL.md`로 명문화 - **연결기** — 이미 쓰는 외부 도구에 접속 (MCP 서버·플러그인) - **서브에이전트** — **만드는 에이전트와 검사하는 에이전트를 분리** - **기록** — 대화 밖에 남는 메모리 (`CLAUDE.md`·`AGENTS.md`·Linear 보드). 모델은 실행 사이마다 다 잊으므로 기록은 디스크에 있어야 함 ## 작성자와 검증자의 분리가 핵심 - 루프 설계에서 가장 중요한 선택은 **코드를 쓰는 에이전트와 검사하는 에이전트를 가르는 것** — 모델이 자기 결과를 채점하면 너무 후함 - Anthropic이 장기 실행 하네스 글에서 공식화한 분리이고, 두 제품의 `/goal` 명령은 **검증 가능한 종료 조건**이 성립할 때까지 에이전트를 굴림 — Claude Code는 별도 모델이 결과를 채점 - Ramp의 Inspect가 6개월 전 같은 구조를 자체 인프라로 구축했는데, 이제 두 생태계에서 기본 기능이 됨 — 닫힌 루프 운용이 기본값이 되는 중 ## 명명자 본인이 가장 조심스럽다 - Osmani는 자기가 이름 붙인 유행에 대해 "아직 초기이고, 나는 회의적"이라고 명시 — **토큰 비용**은 사용 패턴에 따라 크게 출렁임 - 무인으로 도는 루프는 **실수도 무인으로 반복**함 - 가장 날카로운 경고는 **이해 부채(comprehension debt)** — 읽지 않은 코드를 시스템이 계속 출하할 때 벌어지는 간극. 같은 루프를 돌려도 한 사람은 이해한 일에서 더 빨라지고, 다른 사람은 이해 자체를 회피하게 됨 ## 시사점 - 18개월이 안 되는 사이 작업 단위가 **프롬프트 → 컨텍스트 → 하네스 → 루프**로 네 번 이동 — 도구가 아니라 **설계 단위**가 바뀌는 중 - 부품이 두 제품에 같은 모양으로 들어왔으므로, 어느 도구를 쓰느냐보다 **어떤 루프를 설계하느냐**가 차이를 만듦 - 다음 경쟁은 **루프 정의의 이식성** — 루프를 제품 간에 들고 다닐 수 있게 만드는 쪽이 앞선다는 관측 핵심 요약: - 06-06 Boris Cherny의 '내 일은 루프를 쓰는 것' 발언이 X에서 확산됐고, 06-07 Peter Steinberger가 '루프를 설계하라'고 이어받았다. - 06-08 Addy Osmani가 '루프 엔지니어링'으로 패턴에 이름을 붙이고, 필요한 부품 6개를 Codex와 Claude Code 양쪽에 대응시켰다. - 1년 전엔 직접 짜야 했던 부품(예약 실행·워크트리·스킬·연결기·서브에이전트·기록)이 이제 두 제품에 기본으로 들어 있다. 추천: 반복되는 유지보수 작업 하나를 골라 '찾기-고치기-검사하기-기록하기' 루프로 옮겨 작게 실험하라. 루프가 쓴 코드를 읽는 시간을 일정에 함께 잡아야 이해 부채가 쌓이지 않는다. 출처 목록: - (주근거) Loop Engineering — https://addyosmani.com/blog/loop-engineering/ - (보조근거) The Anthropic leader who built Claude Code says he ditched prompting — now he just writes loops — https://thenewstack.io/loop-engineering/ - (커뮤니티신호) Boris Cherny 발언 인용 게시물 — https://x.com/rohanpaul_ai/status/2063289804708835412 - (커뮤니티신호) Peter Steinberger 게시물 — https://x.com/steipete/status/2063697162748260627 - (보조근거) Effective harnesses for long-running agents — https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents --- ## 토큰 청구서가 왔다: 코딩 에이전트의 다음 병목은 회계다 - URL: https://stkradar.com/articles/token-bill-coding-agent-accounting/ - 판정: 채택 (영향도 86/100) - 이벤트: 2026-06-08 - 분류: 프레임워크 · Cursor - 출처: 3개 (주근거 1) - 토픽: Cursor (https://stkradar.com/topics/cursor/) 코딩 에이전트의 병목은 더 이상 모델 성능만이 아니다. Cursor의 Bugbot 과금 전환과 토큰 가격 구조는 작업 단위 비용, 재시도, 검토 실행, 모델 라우팅을 함께 기록하는 회계 계층이 필요해졌다는 신호다. 핵심 요약: - Cursor의 Bugbot 과금 전환은 코딩 에이전트 비용이 좌석 수가 아니라 실제 사용량과 작업 흐름에 묶인다는 점을 드러냈다. - 에이전트 실행은 계획, 수정, 테스트, 검토, 재시도를 반복하므로 한 번의 요청 비용보다 결과당 총비용을 봐야 한다. - 팀은 생산성 주장과 비용 지표를 분리하지 말고 작업 유형, 성공 여부, 검토 비용을 같은 장부에 남겨야 한다. 추천: 채택하되 먼저 비용 장부를 만들라. 작업 종류, 모델, 캐시 사용, 재시도 횟수, 검토 에이전트 실행, 최종 결과를 같은 표에서 추적하는 것이 출발점이다. 출처 목록: - (주근거) May 2026 Bugbot Changes — https://cursor.com/blog/may-2026-bugbot-changes - (보조근거) The token bill comes due — https://techcrunch.com/2026/06/05/the-token-bill-comes-due-inside-the-industry-scramble-to-manage-ais-runaway-costs/ - (보조근거) API pricing — https://openai.com/api/pricing/ --- ## 루프 엔지니어링: 이제 프롬프트하는 시스템을 설계한다 - URL: https://stkradar.com/articles/loop-engineering-agent-work-pattern/ - 판정: 주시 (영향도 82/100) - 이벤트: 2026-06-07 - 분류: 프레임워크 · Addy Osmani - 출처: 3개 (주근거 1) 루프 엔지니어링은 좋은 프롬프트 한 문장을 쓰는 기술이 아니라 작업 발견, 위임, 검증, 상태 기록, 중단 조건을 설계하는 운영 방식이다. 에이전트가 오래 움직일수록 문구보다 루프의 피드백과 통제가 중요해진다. 핵심 요약: - Addy Osmani의 글은 사람이 매번 다음 프롬프트를 쓰는 방식에서 시스템이 다음 행동을 만들고 확인하는 루프 설계로 초점을 옮겼다. - 에이전트의 품질은 프롬프트 문장만이 아니라 컨텍스트 정리, 검증 센서, 권한 경계, 중단 조건의 조합에서 나온다. - 실전 코딩 루프는 빌드, 테스트, 화면 확인, 로그 관찰처럼 결과를 되돌려 주는 장치를 포함해야 의미가 있다. 추천: 반복 업무부터 적용하라. 시작 전 목표, 중단 조건, 검증 명령, 상태 기록, 승인 지점을 적고 읽기 전용 확인 루프에서 먼저 안정성을 확인하는 편이 낫다. 출처 목록: - (주근거) Loop Engineering — https://addyosmani.com/blog/loop-engineering/ - (보조근거) Effective context engineering for AI agents — https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents - (보조근거) Humans and Agents in Software Engineering Loops — https://martinfowler.com/articles/exploring-gen-ai/humans-and-agents.html --- ## AI 에이전트의 첫 대중 인터페이스는 IDE가 아니라 메시지일 수 있다 - URL: https://stkradar.com/articles/messaging-first-ai-agent-interface/ - 판정: 주시 (영향도 80/100) - 이벤트: 2026-06-03 - 분류: SDK · WhatsApp - 출처: 4개 (주근거 1) 개발자에게 에이전트는 IDE와 터미널에서 먼저 보이지만 대중 시장의 첫 접점은 메시지 스레드일 수 있다. WhatsApp의 Meta Business Agent 확장은 고객 운영 에이전트가 신원, 동의, 이관, 감사 기록까지 품은 메시징 제품이어야 함을 보여준다. 핵심 요약: - WhatsApp Business는 Conversations 2026에서 Meta Business Agent를 WhatsApp 중심 고객 접점으로 확장한다고 발표했다. - 공식 설명의 기능 범위는 질문 응답, 상품 추천, 예약, 리드 선별, 판매 마감, 사람 이관까지 메시지 스레드 안에 들어간다. - 메시징 플랫폼은 단순 채팅 UI가 아니라 AI 비서와 고객 운영 자동화의 배포 관문으로 다뤄지기 시작했다. 추천: 고객 접점 에이전트를 만든다면 메시징 채널을 1차 후보로 검토하라. 단, 동의, 사람 이관, 대화 기록 감사, 국가별 정책 대응을 기능 목록이 아니라 구조로 넣어야 한다. 출처 목록: - (주근거) Conversations 2026: Introducing Meta Business Agent on WhatsApp — https://whatsappbusiness.com/blog/introducing-meta-business-agent-ai/ - (보조근거) Be There for Every Customer With Meta Business Agent — https://about.fb.com/news/2026/06/meta-business-agent/ - (보조근거) Meta's AI agent for WhatsApp Business is now available globally — https://techcrunch.com/2026/06/03/metas-ai-agent-for-whatsapp-business-is-now-available-globally/ - (보조근거) Interim measures on Meta and WhatsApp competing AI assistants — https://ec.europa.eu/commission/presscorner/detail/en/ip_26_1276 --- ## OpenAI AgentKit 종료 신호는 코드 소유 Agents SDK 경로를 우선하게 만든다 - URL: https://stkradar.com/articles/openai-agentkit-winddown/ - 판정: 회피 (영향도 90/100) - 판정 변경: 주시 → 회피 - 이벤트: 2026-06-03 - 분류: 프레임워크 · OpenAI - 출처: 2개 (주근거 1) - 토픽: OpenAI (https://stkradar.com/topics/openai/) OpenAI의 2026년 6월 AgentKit 업데이트는 Agent Builder와 평가 제품군의 종료 방향을 담고 있다. 새 에이전트 작업은 시각적 빌더에 묶기보다 Agents SDK와 자체 코드, 테스트, 배포 흐름 안에서 소유하는 편이 안전하다. 핵심 요약: - AgentKit이라는 이름은 남아 있어도 Agent Builder와 평가 제품군에는 종료 신호가 붙었다. - 새 프로젝트의 핵심 경로를 시각적 빌더에 두는 것은 기능 부족보다 제품 지속성 리스크가 더 큰 선택이 됐다. - OpenAI를 계속 쓰더라도 에이전트 로직은 Agents SDK, Responses API, 자체 저장소의 테스트와 배포 파이프라인에 두는 편이 방어적이다. 추천: 새 프로젝트는 Agent Builder 중심 설계를 피하라. 기존 사용자는 현재 빌더 흐름, 평가 기준, 배포 단계를 코드 기반 경로로 옮기는 계획을 먼저 세워야 한다. 출처 목록: - (주근거) Introducing AgentKit — https://openai.com/index/introducing-agentkit/ - (보조근거) Agents — https://developers.openai.com/api/docs/guides/agents --- ## Copilot SDK GA는 코딩 에이전트를 앱 안에 넣는 경계를 열었다 - URL: https://stkradar.com/articles/github-copilot-sdk-ga/ - 판정: 채택 (영향도 88/100) - 이벤트: 2026-06-02 - 분류: SDK · GitHub - 출처: 2개 (주근거 1) - 토픽: GitHub (https://stkradar.com/topics/github/) GitHub Copilot SDK GA는 Copilot을 정해진 편집기나 GitHub 화면 안에서만 쓰는 단계에서, 개발자가 만든 앱과 내부 도구 안에 코딩 에이전트 기능을 넣는 단계로 경계를 넓혔다. 핵심은 SDK 임베딩과 권한 책임이다. 핵심 요약: - GitHub은 2026-06-02 Copilot SDK의 정식 제공을 발표했다. - SDK는 Copilot CLI 뒤의 에이전트 실행 엔진을 JSON-RPC와 여러 언어 SDK로 앱에서 호출하는 구조를 제시한다. - 이제 선택지는 관리형 코딩 에이전트에 일을 맡기는 방식과, 내 제품 안에 Copilot 기능을 심어 직접 흐름을 설계하는 방식으로 나뉜다. 추천: GitHub 저장소와 개발자 도구를 깊게 쓰는 팀은 채택하라. 먼저 내부 도구 하나에 붙여 권한 요청, 파일 수정 범위, 실행 추적, 비용 지표를 확인하는 순서가 현실적이다. 출처 목록: - (주근거) Copilot SDK is now generally available — https://github.blog/changelog/2026-06-02-copilot-sdk-is-now-generally-available/ - (보조근거) github/copilot-sdk — https://github.com/github/copilot-sdk --- ## MCP 2026-07-28 RC는 최종 스펙이 아니라 거버넌스 변화를 예고했다 - URL: https://stkradar.com/articles/mcp-2026-07-28-rc-governance/ - 판정: 주시 (영향도 84/100) - 이벤트: 2026-05-21 - 분류: 프로토콜 · MCP - 출처: 2개 (주근거 1) - 토픽: MCP (https://stkradar.com/topics/mcp/) MCP 2026-07-28 release candidate는 최종 스펙 출시가 아니라 프로토콜 운영 방식의 변화를 예고한 후보안이다. 무상태 core, extensions, authorization hardening, deprecation policy는 MCP가 연결 표준에서 운영 거버넌스 표준으로 넓어지고 있음을 보여준다. 핵심 요약: - MCP 블로그는 2026-05-21에 2026-07-28 스펙 release candidate를 공개했다. - 후보안은 프로토콜 수준 세션 제거, 확장 프레임워크, Tasks 확장, MCP Apps, 인가 강화, 폐기 정책을 함께 제시한다. - 원격 MCP 서버 운영은 sticky session 의존을 줄이고 HTTP 인프라에서 라우팅, 캐시, 추적, 인가를 더 명시적으로 다루는 방향으로 이동한다. 추천: 원격 MCP 서버를 운영한다면 관찰과 사전 설계를 시작하라. 최종 스펙처럼 박아 넣기보다 세션, 캐시, 인가, 확장 의존 지점을 먼저 목록화해야 한다. 출처 목록: - (주근거) The 2026-07-28 MCP Specification Release Candidate — https://blog.modelcontextprotocol.io/posts/2026-07-28-release-candidate/ - (보조근거) Authorization - Model Context Protocol draft specification — https://modelcontextprotocol.io/specification/draft/basic/authorization --- ## NSA의 MCP 보안 고려사항은 프로토콜 운영 점검표가 필요하다는 신호다 - URL: https://stkradar.com/articles/nsa-mcp-security-design-considerations/ - 판정: 주시 (영향도 82/100) - 이벤트: 2026-05-20 - 분류: 프로토콜 · NSA - 출처: 2개 (주근거 1) NSA의 MCP 보안 설계 고려사항은 MCP가 개발자 편의 프로토콜을 넘어 운영 점검표의 대상이 됐다는 신호다. 이것은 법적 의무 선언이 아니라 도구 권한, 서버 신뢰, 데이터 경계, 감시 체계를 배포 전 검토하라는 기준점에 가깝다. 핵심 요약: - NSA는 2026-05-20 MCP를 활용한 AI 자동화 보안 설계 고려사항을 공개했다. - 문서는 MCP 서버, 클라이언트, 도구 권한, 데이터 접근, 운영 감시 같은 항목을 보안 관점에서 점검하게 한다. - MCP 도입 논의는 이제 연결 편의성만이 아니라 서버 신뢰, 권한 최소화, 로그 보존, 사람 승인 경계를 함께 다뤄야 한다. 추천: MCP 서버를 외부 도구나 비공개 데이터에 연결하는 팀은 이 문서를 설계 검토 기준으로 쓰라. 권한 최소화, 서버 신뢰성, 로그 보존, 도구별 승인 경계를 문서화해야 한다. 출처 목록: - (주근거) NSA Releases Security Design Considerations for AI-Driven Automation Leveraging MCP — https://www.nsa.gov/Press-Room/Press-Releases-Statements/Press-Release-View/Article/4496698/nsa-releases-security-design-considerations-for-ai-driven-automation-leveraging/ - (보조근거) Security Design Considerations for AI-Driven Automation Leveraging MCP — https://www.nsa.gov/Portals/75/documents/Cybersecurity/CSI_MCP_SECURITY.pdf?ver=bmgiSbNQLP6Z_GiWtRt6bg%3D%3D --- ## Claude Managed Agents self-hosted sandbox는 실행 경계를 사용자 인프라로 옮긴다 - URL: https://stkradar.com/articles/anthropic-managed-agents-self-hosted-sandboxes/ - 판정: 실험 (영향도 80/100) - 이벤트: 2026-05-19 - 분류: SDK · Anthropic - 출처: 2개 (주근거 1) - 토픽: Anthropic (https://stkradar.com/topics/anthropic/) Anthropic의 self-hosted sandbox 흐름은 Claude Managed Agents의 조율은 유지하면서 도구 실행, 파일시스템, 네트워크 경계를 사용자 인프라로 옮기는 선택지다. 민감한 저장소와 내부망 접근이 필요한 팀에는 실험 가치가 있지만, 연구 미리보기와 워커 운영 부담을 함께 봐야 한다. 핵심 요약: - Anthropic API release notes는 2026-05-19 Claude Managed Agents용 self-hosted sandboxes 제공을 기록했다. - 도구 실행 위치, 파일과 프로세스, 네트워크 접근은 사용자 인프라가 통제하고 조율과 모델 판단은 Anthropic 제어 평면을 통과한다. - MCP tunnels와 self-hosted sandbox는 별개 축으로 설명되어, 내부 MCP 접근과 도구 실행 위치를 조합할 수 있다. 추천: 내부망, 규정 준수, 감사 통제가 필요한 팀은 제한된 워크로드로 실험하라. 개인 개발자는 관리형 기본 환경과 로컬 MCP 서버 분리만으로 충분한지 먼저 확인하는 편이 낫다. 출처 목록: - (주근거) Claude API release notes — https://docs.anthropic.com/en/release-notes/api - (보조근거) Self-hosted sandboxes — https://platform.claude.com/docs/en/managed-agents/self-hosted-sandboxes --- ## MCP Atlas는 실제 서버 기반 도구 평가를 에이전트 품질 기준으로 올렸다 - URL: https://stkradar.com/articles/mcp-atlas-real-server-tool-eval/ - 판정: 실험 (영향도 86/100) - 이벤트: 2026-05-19 - 분류: 평가 · arXiv - 출처: 2개 (주근거 1) - 토픽: arXiv (https://stkradar.com/topics/arxiv/) MCP Atlas는 도구 호출 평가를 장난감 API 목록에서 실제 MCP 서버, 교차 서버 작업, 주장 단위 채점으로 끌어올린 벤치마크다. MCP를 붙였다는 사실보다, 여러 서버의 도구를 고르고 결과 주장을 끝까지 검증하는 능력이 에이전트 품질 기준이 됐다. 핵심 요약: - 실제 MCP 서버 36개와 도구 220개를 포함해, 벤치마크 환경을 제품에 가까운 도구 표면으로 넓혔다. - 1,000개 과제는 단일 호출 정답뿐 아니라 여러 서버를 오가는 작업과 최종 답변의 세부 주장까지 본다. - MCP 연결 자체가 차별점이던 단계에서, 연결된 도구를 신뢰할 만하게 선택하고 검증하는 단계로 평가 초점이 이동했다. 추천: MCP 도구가 많은 제품은 이 흐름을 평가 설계에 실험적으로 반영하라. 서버 간 작업, 권한 실패, 잘못된 도구 결과, 답변 속 주장 검증을 사내 회귀 세트에 넣는 것이 단순 호출 성공률보다 낫다. 출처 목록: - (주근거) MCP Atlas: A Benchmark for Evaluating Tool Use in MCP-based Agents — https://arxiv.org/abs/2602.00933 - (보조근거) MCP Atlas Leaderboard — https://labs.scale.com/leaderboard/mcp_atlas --- ## Docker MCP Custom Catalogs와 Profiles GA는 도구 배포 거버넌스를 구체화했다 - URL: https://stkradar.com/articles/docker-mcp-custom-catalogs-profiles-ga/ - 판정: 실험 (영향도 79/100) - 이벤트: 2026-05-15 - 분류: 프로토콜 · Docker - 출처: 2개 (주근거 1) Docker의 Custom Catalogs와 Profiles 일반 제공은 MCP 서버를 개인별 설정 파일이 아니라 조직이 승인하고 배포하는 도구 묶음으로 다루게 만든다. MCP를 팀 운영에 넣는 곳에는 의미 있는 거버넌스 표면이지만, 개인 실험에는 절차가 먼저 커질 수 있다. 핵심 요약: - Docker는 2026-05-15 Custom Catalogs와 Profiles 일반 제공을 발표했다. - Custom Catalogs는 조직이 승인한 MCP 서버 목록을 배포하는 단위가 된다. - Profiles는 프로젝트별 MCP 서버 묶음을 저장하고 공유하는 운용 단위로 제시됐다. - MCP 도구 선택이 개발자 개인의 `mcp.json` 관리에서 조직 차원의 승인 목록과 프로필 배포 문제로 이동한다. 추천: MCP 서버를 여러 팀원이 공유하거나 승인된 도구 목록이 필요한 조직은 실험하라. 개인 프로젝트는 단순 설정으로 시작하고, 승인·감사 요구가 생길 때 도입해도 늦지 않다. 출처 목록: - (주근거) Custom MCP Catalogs and Profiles: Advancing Enterprise MCP Adoption — https://www.docker.com/blog/create-custom-mcp-catalogs-and-profiles/ - (보조근거) Docker MCP Catalog and Toolkit — https://docs.docker.com/ai/mcp-catalog-and-toolkit/ --- ## 노션은 메모 앱이 아니라 에이전트 작업장이 되려 한다 - URL: https://stkradar.com/articles/notion-agent-workspace-platform/ - 판정: 주시 (영향도 84/100) - 이벤트: 2026-05-13 - 분류: 프레임워크 · Notion - 출처: 3개 (주근거 1) Notion의 개발자 플랫폼 발표는 메모 앱에 AI 요약을 붙인 수준이 아니다. 데이터베이스 동기화, Workers, 웹훅, CLI, 외부 에이전트 API를 묶어 팀 지식 공간을 에이전트가 읽고 일하는 작업장으로 바꾸려는 방향이다. 핵심 요약: - Notion은 2026-05-13 릴리스에서 Workers, database sync, agent tools, webhook triggers, CLI, External Agents/API를 한 플랫폼 묶음으로 제시했다. - 외부 에이전트가 Notion 안에서 대화하고 작업을 배정받고 진행 상태를 남기는 참여자가 되는 방향을 열었다. - Notion 3.0 Agents 이후 팀 지식 공간은 문서 보관소에서 외부 데이터, 코드 실행, 에이전트 연결 표면으로 확장되고 있다. 추천: 팀 문서와 업무 데이터가 이미 Notion에 있다면 관찰 우선으로 준비하라. 외부 에이전트 연결은 권한 범위, 감사 로그, 대기 목록이나 제공 상태를 확인한 뒤 낮은 위험의 읽기 중심 업무부터 붙이는 편이 낫다. 출처 목록: - (주근거) May 13, 2026 - 3.5: Notion Developer Platform — https://www.notion.com/releases/2026-05-13 - (보조근거) Introducing Notion's Developer Platform — https://www.notion.com/blog/introducing-developer-platform - (보조근거) Notion launches developer platform — https://techcrunch.com/2026/05/13/notion-just-turned-its-workspace-into-a-hub-for-ai-agents/ --- ## METR time horizon은 에이전트 평가를 인간 작업 길이 기준으로 읽게 했다 - URL: https://stkradar.com/articles/metr-time-horizon-agent-eval/ - 판정: 채택 (영향도 89/100) - 이벤트: 2026-05-08 - 분류: 평가 · METR - 출처: 2개 (주근거 1) METR의 time horizon은 에이전트 성능을 벤치마크 점수 하나가 아니라 인간 전문가가 어느 정도 걸리는 작업을 일정 성공률로 풀 수 있는지로 읽게 하는 평가 렌즈다. 이 값은 에이전트가 그 시간 동안 끊김 없이 자율 실행한다는 뜻이 아니며, 도입 설명에서 그 오해를 막는 것이 핵심이다. 핵심 요약: - METR은 2026-05-08 업데이트에서 time horizon 1.1과 16시간 초과 측정의 신뢰 한계를 함께 표시했다. - 평가 단위는 에이전트 실행 시간이 아니라, 인간 전문가가 작업을 끝내는 데 걸리는 추정 시간과 성공 확률의 관계다. - 모델, 스캐폴드, 작업 환경을 함께 측정하므로 단순 모델 순위표보다 실제 에이전트 구성에 가깝다. 추천: 에이전트 성능을 설명하고 비교하는 내부 언어로 채택하라. 단, 수치를 실제 자율 실행 시간처럼 말하지 말고 작업 난도, 성공률, 스캐폴드 조건을 함께 표기해야 한다. 출처 목록: - (주근거) Task-Completion Time Horizons of Frontier AI Models — https://metr.org/time-horizons/ - (보조근거) Measuring AI ability to complete long tasks — https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/ --- ## 프롬프트는 PR 설명이 됐다: AI 코드 리뷰는 의도부터 본다 - URL: https://stkradar.com/articles/prompt-as-pr-description/ - 판정: 주시 (영향도 79/100) - 이벤트: 2026-05-07 - 분류: 평가 · GitHub - 출처: 3개 (주근거 1) - 토픽: GitHub (https://stkradar.com/topics/github/) 에이전트 PR에서 설명문은 변경 요약을 넘어 원 요청, 금지 범위, 선택한 계획, 검증 증거를 담는 리뷰 계약서가 됐다. 리뷰어는 diff만 보는 대신 에이전트가 무엇을 하기로 했고 무엇을 하지 않기로 했는지부터 확인해야 한다. 핵심 요약: - GitHub는 2026-05-07 글에서 에이전트 PR 작성자가 본문을 편집하고, 의도와 큰 변경의 계획, 검증 맥락을 남겨야 한다고 설명했다. - 클라우드 에이전트 흐름은 프롬프트를 받아 저장소를 조사하고 계획을 세운 뒤 브랜치 변경과 PR 생성으로 이어진다. - PR 리뷰의 입력이 최종 diff에서 원 프롬프트, 작업 로그, 검증 범위, 사람이 다시 판단해야 할 지점까지 넓어졌다. 추천: 에이전트 PR 본문에는 원 요청, 금지 범위, 선택하지 않은 대안, 실행한 검증, 사람이 재확인할 판단을 남겨라. 단, 프롬프트에 포함된 비밀이나 민감 자료는 그대로 붙이지 말아야 한다. 출처 목록: - (주근거) Agent pull requests are everywhere. Here's how to review them. — https://github.blog/ai-and-ml/generative-ai/agent-pull-requests-are-everywhere-heres-how-to-review-them/ - (보조근거) About Copilot coding agent — https://docs.github.com/en/copilot/concepts/agents/cloud-agent/about-cloud-agent - (보조근거) How we built a high-quality AI code review agent — https://www.augmentcode.com/blog/how-we-built-high-quality-ai-code-review-agent --- ## 에이전트 회계학: 토큰을 많이 쓴 사람이 생산적인 사람은 아니다 - URL: https://stkradar.com/articles/agent-accounting-token-productivity/ - 판정: 채택 (영향도 82/100) - 이벤트: 2026-05-06 - 분류: 평가 · Anthropic - 출처: 3개 (주근거 1) - 토픽: Anthropic (https://stkradar.com/topics/anthropic/) 에이전트 사용량은 생산성 점수가 아니다. 한도와 과금이 커질수록 팀은 토큰, 요청 수, 좌석 수를 보는 데서 멈추지 말고 병합된 변경, 검토 시간, 되돌림, 장애 위험까지 연결해 결과당 비용을 봐야 한다. 핵심 요약: - Anthropic의 2026-05-06 한도 조정은 코딩 에이전트 경험이 모델 품질뿐 아니라 컴퓨팅 용량과 사용 제한에 묶인다는 점을 드러냈다. - GitHub는 클라우드 에이전트의 성과를 생성량보다 PR 생성, 병합, 병합까지 걸린 시간 같은 작업 생명주기 지표로 설명한다. - Cursor 같은 도구의 팀 사용량 분석과 중앙 과금은 에이전트 운영이 비용 회계와 조직 관리 영역으로 들어왔음을 보여준다. 추천: 토큰 사용량을 개인 생산성 순위로 쓰지 말라. 작업 유형, 모델, 파일 범위, 검토 시간, 병합 여부, 되돌림 여부를 함께 저장해 결과당 비용과 남은 위험을 추적하라. 출처 목록: - (주근거) Higher limits, more capacity, and SpaceX — https://www.anthropic.com/news/higher-limits-spacex - (보조근거) About Copilot coding agent — https://docs.github.com/en/copilot/concepts/agents/cloud-agent/about-cloud-agent - (보조근거) Pricing — https://cursor.com/pricing --- ## Cursor TypeScript SDK는 코딩 에이전트 실행 환경을 제품 안으로 열었다 - URL: https://stkradar.com/articles/cursor-sdk-programmatic-agents/ - 판정: 실험 (영향도 82/100) - 이벤트: 2026-04-29 - 분류: SDK · Cursor - 출처: 2개 (주근거 1) - 토픽: Cursor (https://stkradar.com/topics/cursor/) Cursor TypeScript SDK는 Cursor의 코딩 에이전트 실행 환경과 모델 접근을 프로그램에서 호출하게 만드는 표면이다. 편집기 기능을 자동화 코드와 제품 기능으로 끌어내는 시도이지만, 초기 SDK인 만큼 권한 경계와 세션 비용을 작게 검증해야 한다. 핵심 요약: - Cursor는 2026-04-29 TypeScript SDK를 공개해 Cursor 에이전트 실행 환경을 앱과 자동화 코드에서 부를 수 있게 했다. - 블로그는 데스크톱, CLI, 웹앱 뒤의 실행 환경과 모델을 SDK 표면으로 노출하는 방향을 설명한다. - 코딩 에이전트가 편집기 안 대화 기능을 넘어 CI 보조, 내부 개발자 도구, 고객 제품 기능으로 들어갈 수 있는 경로가 생겼다. 추천: Cursor를 이미 쓰는 개발자 도구 팀은 내부 자동화나 작은 사내 도구부터 실험하라. 고객용 자동 수정 기능은 저장소 권한, 세션 비용, 결과 검토 책임을 문서화한 뒤에 열어야 한다. 출처 목록: - (주근거) Cursor TypeScript SDK — https://cursor.com/blog/typescript-sdk - (보조근거) Cursor Blog — https://cursor.com/blog --- ## Devin CLI는 로컬 터미널과 클라우드 에이전트 사이의 인계 흐름을 드러냈다 - URL: https://stkradar.com/articles/cognition-devin-cli-cloud-handoff/ - 판정: 주시 (영향도 80/100) - 이벤트: 2026-04-27 - 분류: SDK · Cognition - 출처: 2개 (주근거 1) Devin for Terminal은 로컬 터미널에서 시작한 코딩 작업을 클라우드 컴퓨터의 Devin 세션으로 넘기는 사용 방식을 전면에 세웠다. 핵심은 완전 자율 개발자라는 수사가 아니라, 로컬 맥락 확보와 클라우드 장기 실행을 어떻게 인계하고 검토할지다. 핵심 요약: - Cognition은 2026-04-27 Devin for Terminal을 공개해 로컬 터미널에서 Devin 작업을 시작하는 경로를 열었다. - 사용자는 터미널에서 대화를 시작하고, 더 긴 실행이나 별도 환경이 필요할 때 클라우드 컴퓨터의 Devin 세션으로 넘길 수 있다. - 로컬 보조 도구와 클라우드 코딩 에이전트를 별개 제품으로 고르는 대신, 작업 단계에 따라 이동하는 흐름이 뚜렷해졌다. 추천: 긴 저장소 작업을 자주 맡기는 팀은 주시하라. 첫 실험은 읽기 중심 조사나 작은 수정으로 제한하고, 비용 한도, 접근 권한, 풀 리퀘스트 검토 기준을 먼저 정해야 한다. 출처 목록: - (주근거) Devin for Terminal — https://cognition.ai/blog/devin-for-terminal - (보조근거) Devin can now manage Devins — https://cognition.ai/blog/devin-can-now-manage-devins --- ## 세션 기억 vs 제품 기억: supermemory는 agentmemory를 대체할 수 있을까 - URL: https://stkradar.com/articles/supermemory-agentmemory-replacement/ - 판정: 실험 (영향도 78/100) - 이벤트: 2026-04-27 - 분류: SDK · Supermemory - 출처: 10개 (주근거 1) Supermemory는 @supermemory/tools 2.0.0에서 대화 식별자와 기본 저장을 전면화했고, MCP, 플러그인, 로컬 서버를 통해 기억 계층을 넓히고 있다. agentmemory처럼 코딩 세션을 자동 수집하는 전용 장치를 바로 대체한다고 보기는 어렵지만, 제품 안에 사용자 기억, RAG, 외부 자료 연결을 넣으려는 팀에는 교체 실험 후보가 됐다. 핵심 요약: - 2026-04-27 공식 글은 @supermemory/tools 2.0.0이 주요 에이전트 SDK 통합을 config 객체로 통일하고 customId로 대화 식별을 필수화했으며, 대화 종료 후 기억 저장을 기본값으로 바꿨다고 설명한다. - 공식 저장소와 MCP 문서는 기억, 검색, 사용자 프로필, 문서 검색, 외부 연결, 로컬 실행을 한 API와 MCP 서버로 묶는다. - agentmemory는 코딩 에이전트 세션, 자동 후크, MCP 도구, 로컬 실행과 재현 가능한 벤치마크를 앞세워 개발 작업 기억에 집중한다. 추천: 제품의 사용자 기억, RAG, 외부 자료 연결을 빠르게 붙이려면 Supermemory를 작은 기능에서 실험하라. Codex와 Claude Code 작업 기억, 세션 감사, 로컬 우선 장치를 이미 agentmemory에 맡겼다면 바로 갈아타지 말고 같은 대화 로그로 검색 품질, 내보내기, 비용, 삭제 흐름을 비교하라. 출처 목록: - (주근거) Introducing @supermemory/tools v2.0.0 — https://supermemory.ai/blog/introducing-supermemory-tools-v2-0-0/ - (보조근거) supermemoryai/supermemory — https://github.com/supermemoryai/supermemory - (보조근거) Supermemory MCP Server 4.0 Overview — https://supermemory.ai/docs/supermemory-mcp/mcp - (보조근거) Catch up with our UNFORGETTABLE Launch Week — https://supermemory.ai/blog/catch-up-with-our-unforgettable-launch-week/ - (보조근거) rohitg00/agentmemory — https://github.com/rohitg00/agentmemory - (보조근거) AGENTMEMORY - Persistent Memory for AI Coding Agents — https://www.agent-memory.dev/ - (보조근거) How agentmemory works, and how to actually use it to with your agent — https://alphasignalai.substack.com/p/how-agentmemory-works-and-how-to - (커뮤니티신호) [agent memory] Supermemory vs Hindsight — https://www.reddit.com/r/AI_Agents/comments/1szwjat/agent_memory_supermemory_vs_hindsight/ - (커뮤니티신호) Ask HN: Thinking about memory for AI coding agents — https://news.ycombinator.com/item?id=46742800 - (커뮤니티신호) Supermemory Tutorial: Add Persistent Memory to AI Agents — https://www.datacamp.com/tutorial/supermemory-tutorial --- ## Cloudflare Browser Run은 에이전트용 브라우저 실행을 Cloudflare 계정 안으로 넣었다 - URL: https://stkradar.com/articles/cloudflare-browser-run/ - 판정: 실험 (영향도 84/100) - 이벤트: 2026-04-15 - 분류: SDK · Cloudflare - 출처: 2개 (주근거 1) - 토픽: Cloudflare (https://stkradar.com/topics/cloudflare/) Cloudflare Browser Run은 에이전트가 쓰는 Playwright 기반 브라우저 실행을 Cloudflare 계정 안의 인프라 선택지로 만든다. 브라우저 작업이 많은 팀에는 실험 가치가 있지만, 세션 보존, 차단 대응, 비용이 핵심이다. 핵심 요약: - Cloudflare는 2026-04-15 AI 에이전트용 Browser Run을 발표해 브라우저 실행을 Cloudflare 개발자 플랫폼의 한 기능으로 제시했다. - 공식 문서는 Playwright와 MCP 연결을 통해 에이전트가 원격 브라우저 작업을 수행하는 흐름을 설명한다. - 렌더링, 네트워크 위치, 실행 자원 운영 부담 일부가 Cloudflare 계정과 설정 안으로 들어왔다. 추천: Cloudflare 계정 안에서 브라우저 작업을 많이 실행하거나 Workers와 함께 묶을 계획이면 작은 자동화부터 실험하라. 로그인 세션이 긴 작업, 크롤링성 작업, 차단에 민감한 작업은 비용과 정책을 먼저 측정해야 한다. 출처 목록: - (주근거) Browser Run for AI agents — https://blog.cloudflare.com/browser-run-for-ai-agents/ - (보조근거) Playwright MCP — https://developers.cloudflare.com/browser-run/playwright/playwright-mcp/ --- ## Cloudflare Project Think는 장기 실행 에이전트 기반을 넓힌다 - URL: https://stkradar.com/articles/cloudflare-project-think-agents-sdk/ - 판정: 주시 (영향도 83/100) - 이벤트: 2026-04-15 - 분류: 프레임워크 · Cloudflare - 출처: 2개 (주근거 1) - 토픽: Cloudflare (https://stkradar.com/topics/cloudflare/) Cloudflare Project Think는 Agents SDK를 짧은 서버리스 호출이 아니라 더 오래 살아 있는 에이전트 실행 환경으로 확장하려는 신호다. Durable Objects와 엣지 배포를 쓰는 팀에는 흥미롭지만, 업무 이력과 실패 복구는 전용 도구와 비교해야 한다. 핵심 요약: - Cloudflare는 2026-04-15 Project Think를 공개하며 Agents SDK가 더 긴 작업과 상태 있는 에이전트를 다루는 방향을 제시했다. - Durable Objects 기반 상태와 실행 환경이 결합되면 대기, 재개, 외부 도구 호출을 Cloudflare 안에서 설계할 수 있다. - Workers 중심 제품은 별도 조율 서버 전에 엣지 실행, 상태 보존, 에이전트 SDK를 한 묶음으로 검토할 수 있다. 추천: Cloudflare Workers와 Durable Objects를 이미 쓰는 팀은 내부 보조 업무로 실험해볼 만하다. 클라우드 중립성이나 강한 업무 이력이 중요하면 Temporal류 도구와 비교하라. 출처 목록: - (주근거) Project Think — https://blog.cloudflare.com/project-think/ - (보조근거) Agents — https://developers.cloudflare.com/agents/ --- ## E2B의 OpenAI Agents SDK 통합은 에이전트 실행환경을 제품 기능으로 올렸다 - URL: https://stkradar.com/articles/e2b-agents-sdk-sandbox/ - 판정: 실험 (영향도 81/100) - 이벤트: 2026-04-15 - 분류: SDK · E2B - 출처: 2개 (주근거 1) E2B의 OpenAI Agents SDK 통합은 에이전트가 파일을 만들고 shell을 실행하는 작업 공간을 외부 샌드박스 제공자로 분리한다. 코드 생성, 웹페이지 변형, 데이터 처리에는 실험 가치가 크지만, 비용과 산출물 반출, Python 우선 지원을 먼저 확인해야 한다. 핵심 요약: - E2B는 2026-04-15 OpenAI Agents SDK 샌드박스 제공자 지원을 발표해 격리 실행 환경을 에이전트 기본 실행 표면으로 올렸다. - 공식 글은 파일 편집, shell 명령, 임시 작업 공간 상태, preview URL, 병렬 샌드박스를 핵심 기능으로 설명한다. - 지원은 Python Agents SDK에 먼저 제공되고 TypeScript 지원은 예정으로 적혀 있어 언어 선택이 초기 도입 범위를 제한한다. 추천: 파일과 shell이 필요한 코드 생성, 데이터 처리, 웹 산출물 에이전트라면 작은 작업부터 실험하라. 비용 상한, 산출물 내보내기, 비밀값 주입, TypeScript 지원 상태를 채택 전 확인해야 한다. 출처 목록: - (주근거) E2B is now supported in the OpenAI Agents SDK — https://e2b.dev/blog/e2b-is-now-in-agents-sdk - (보조근거) The next evolution of the Agents SDK — https://openai.com/index/the-next-evolution-of-the-agents-sdk/ --- ## HIL-Bench는 에이전트가 언제 질문해야 하는지를 평가 대상으로 만들었다 - URL: https://stkradar.com/articles/hil-bench-human-escalation-eval/ - 판정: 실험 (영향도 84/100) - 이벤트: 2026-04-10 - 분류: 평가 · arXiv - 출처: 2개 (주근거 1) - 토픽: arXiv (https://stkradar.com/topics/arxiv/) HIL-Bench는 에이전트 안전을 '사람 승인 버튼이 있는가'가 아니라 '언제 사람에게 물어야 하는가'로 옮겨 평가한다. 위험하거나 모호한 작업을 맡기는 제품은 정답률만 보지 말고 질문 타이밍, 과잉 질의, 침묵 추측을 함께 측정해야 한다. 핵심 요약: - 2026-04-10 제출된 HIL-Bench 논문은 사람 개입을 에이전트 평가의 부속 절차가 아니라 독립된 능력으로 다룬다. - 모호한 정보, 위험한 행동, 사용자 의도 불확실성에서 에이전트가 묻거나 멈춰야 하는지를 지표화한다. - Ask-F1 같은 지표는 무조건 질문을 많이 하는 에이전트와 위험 순간에도 추측하는 에이전트를 함께 걸러내려는 장치다. 추천: 외부 시스템 변경, 결제, 고객 응답, 자료 삭제처럼 되돌리기 어려운 행동을 하는 에이전트라면 평가 항목에 넣어라. 너무 자주 묻는 실패와 물어야 할 때 묻지 않는 실패를 별도 로그로 남기는 것이 중요하다. 출처 목록: - (주근거) HIL-Bench: Evaluating LLM Agent Human-in-the-Loop Capabilities — https://arxiv.org/abs/2604.09408 - (보조근거) HIL — https://scale.com/blog/hil --- ## Microsoft Agent Framework 1.0은 Semantic Kernel/AutoGen 수렴의 생산 단계 신호다 - URL: https://stkradar.com/articles/microsoft-agent-framework-10/ - 판정: 주시 (영향도 80/100) - 이벤트: 2026-04-03 - 분류: 프레임워크 · Microsoft - 출처: 3개 (주근거 1) - 토픽: Microsoft (https://stkradar.com/topics/microsoft/) Microsoft Agent Framework 1.0은 Semantic Kernel과 AutoGen 계열을 Python/.NET 공통 프레임워크로 수렴시키겠다는 신호다. Microsoft 흐름을 쓰는 팀에는 생산 단계 후보지만, 작은 제품은 SDK 무게와 플랫폼 결합을 먼저 재야 한다. 핵심 요약: - Microsoft는 Agent Framework 1.0에서 Semantic Kernel의 기업형 기반과 AutoGen의 다중 에이전트 조율 흐름을 하나의 오픈소스 SDK 방향으로 묶었다. - Python과 .NET을 모두 1.0 표면으로 내세우며 안정된 API, 장기 지원, 운영 투입 가능성을 강조했다. - 작업 흐름, 도구, 메모리/영속성, 호스팅, MCP/A2A 통합을 한 문서 체계에 넣었다. 추천: Azure AI Foundry, .NET/Python 혼합, 기업형 다중 에이전트 작업 흐름이 핵심이면 관찰 후보로 올려라. 솔로 빌더는 작은 내부 업무로 SDK 표면과 제공자 경계를 확인한 뒤 판단하는 편이 낫다. 출처 목록: - (주근거) Microsoft Agent Framework Version 1.0 — https://devblogs.microsoft.com/agent-framework/microsoft-agent-framework-version-1-0/ - (보조근거) Agent Framework documentation — https://learn.microsoft.com/en-us/agent-framework/ - (보조근거) microsoft/agent-framework — https://github.com/microsoft/agent-framework --- ## Google ADK for Java 1.0.0은 기존 Java 백엔드에 에이전트 선택지를 열었다 - URL: https://stkradar.com/articles/google-adk-java-100/ - 판정: 주시 (영향도 77/100) - 이벤트: 2026-03-30 - 분류: SDK · Google ADK - 출처: 2개 (주근거 1) Google ADK for Java 1.0.0은 Java 기반 백엔드와 기업 코드베이스에서 Google의 에이전트 스택을 더 현실적인 후보로 만든다. 다만 선택은 Google 서비스와 A2A 연동 방향을 받아들일지에 달려 있다. 핵심 요약: - Google은 2026-03-30 ADK for Java 1.0.0을 발표했다. - Java 지원은 기존 Spring/엔터프라이즈 백엔드가 Python 중심 에이전트 스택을 우회할 수 있는 경로를 만든다. - ADK 선택은 A2A 연동, Google 서비스, Java 배포 운영 모델을 함께 받아들이는 결정에 가깝다. 추천: Java 백엔드가 핵심인 팀은 주시하면서 작은 내부 도구 에이전트로 검증하라. Google 서비스 의존을 원치 않으면 중립 SDK와 비교해야 한다. 출처 목록: - (주근거) Announcing ADK for Java 1.0.0: Building the future of AI agents in Java — https://developers.googleblog.com/announcing-adk-for-java-100-building-the-future-of-ai-agents-in-java/ - (보조근거) Get started with Java — https://adk.dev/get-started/java/ --- ## 177,000개 MCP 도구 연구는 도구 계층 평가가 필수 게이트가 됐다는 최신 신호다 - URL: https://stkradar.com/articles/mcp-tool-bench/ - 판정: 채택 (영향도 84/100) - 이벤트: 2026-03-25 - 분류: 평가 · arXiv - 출처: 3개 (주근거 1) - 토픽: arXiv (https://stkradar.com/topics/arxiv/) 2026-03-25 제출된 177,000개 MCP 도구 연구는 2025년 MCP tool-use benchmark 흐름 위에 최신 dated signal을 더한다. 에이전트 성능은 모델 답변이 아니라 도구 선택/호출 단위로 평가해야 한다. 핵심 요약: - 2026-03-25 177k MCP tools paper는 agent 평가가 정답 문장 비교에서 실제 도구 계층 점검으로 이동한다는 최신 신호다. - MCP 도구 목록이 커지면서 도구 계층 자체가 위험과 성능을 점검해야 할 대상이 된다. - 추적 채점과 권한 경계 테스트가 에이전트 스택의 기본 품질 게이트가 된다. 추천: 도구 에이전트를 만들면 최소한 방해 도구, 권한 경계, 실패한 도구 호출 복구 테스트를 넣어야 한다. 출처 목록: - (주근거) How are AI agents used? Evidence from 177,000 MCP tools — https://arxiv.org/abs/2603.23802 - (보조근거) MCPAgentBench: A Real-world Task Benchmark for Evaluating LLM Agent MCP Tool Use — https://arxiv.org/abs/2512.24565 - (보조근거) MCPToolBench++: A Large Scale AI Agent Model Context Protocol MCP Tool Use Benchmark — https://arxiv.org/abs/2508.07575 --- ## Dapr Agents 1.0 GA는 분산 시스템 기반 에이전트 프레임워크를 전면에 세웠다 - URL: https://stkradar.com/articles/dapr-agents-10-ga/ - 판정: 주시 (영향도 82/100) - 이벤트: 2026-03-23 - 분류: 프레임워크 · CNCF - 출처: 2개 (주근거 1) Dapr Agents 1.0 일반 제공은 상태, 메시징, 관측성, 재시도 같은 분산 시스템 요소를 에이전트 프레임워크 판단 기준으로 끌어올렸다. Dapr 기반 조직에는 주시할 가치가 크다. 핵심 요약: - CNCF는 2026-03-23 Dapr Agents 일반 제공을 발표했다. - Dapr Agents는 Dapr의 상태 관리, 메시징, 워크플로 엔진을 에이전트 실행 기반으로 사용한다. - 에이전트 프레임워크 선택에서 모델 호출보다 실패 복구와 분산 실행 기반이 더 중요한 축으로 올라왔다. 추천: Dapr를 이미 쓰는 팀은 주시 단계에서 파일럿으로 옮길 만하다. Dapr 경험이 없다면 먼저 작은 내부 작업으로 운영 부담을 확인하라. 출처 목록: - (주근거) General Availability of Dapr Agents Delivers Production Reliability for Enterprise AI — https://www.cncf.io/announcements/2026/03/23/general-availability-of-dapr-agents-delivers-production-reliability-for-enterprise-ai/ - (보조근거) Dapr Agents — https://docs.dapr.io/developing-ai/dapr-agents/ --- ## A2A v1.0.0은 에이전트 간 상호운용 프로토콜을 구체화했다 - URL: https://stkradar.com/articles/a2a-watch/ - 판정: 주시 (영향도 76/100) - 이벤트: 2026-03-12 - 분류: 프로토콜 · A2A 스펙 - 출처: 2개 (주근거 1) A2A v1.0.0은 Agent Card, Task, Artifact, 스트리밍 업데이트 모델을 구체적인 에이전트 간 프로토콜로 묶었다. 다만 개인 개발자는 외부 에이전트 상호운용이 필요할 때까지 기다려도 된다. 핵심 요약: - 2026-03-12 v1.0.0 출시는 Agent Card로 기능을 공개하고 Task/Artifact 단위로 에이전트 간 협업을 표준화하는 기준점을 만들었다. - 장기 작업은 스트리밍 업데이트나 주기적 조회를 통해 진행 상태를 노출하는 쪽으로 설계된다. - 프레임워크 내부 인계와 외부 에이전트 간 전송 계층을 분리해서 봐야 한다. 추천: 엔터프라이즈/파트너 연동은 주시하라. 개인/소규모 제품은 내부 인계와 추적 구조를 먼저 단단히 잡는 것이 낫다. 출처 목록: - (주근거) Agent2Agent (A2A) Protocol Specification — https://a2a-protocol.org/latest/specification/ - (보조근거) A2A v1.0.0 — https://github.com/a2aproject/A2A/releases/tag/v1.0.0 --- ## 에이전트 정책 파일은 시스템 프롬프트를 대신하지 않는다 - URL: https://stkradar.com/articles/agent-policy-files-not-system-prompts/ - 판정: 주시 (영향도 78/100) - 이벤트: 2026-02-23 - 분류: 프레임워크 · arXiv - 출처: 3개 (주근거 1) - 토픽: arXiv (https://stkradar.com/topics/arxiv/) AGENTS.md 같은 저장소 정책 파일은 프로젝트별 명령, 금지 경로, 검증 기준을 리뷰 가능한 파일로 끌어낸다. 하지만 보안 경계가 아니며, 길고 일반적인 규칙 덩어리는 오히려 비용과 실패를 늘릴 수 있다. 핵심 요약: - 2026-02-23 arXiv 논문은 저장소 수준 문맥 파일이 항상 성능을 높이지 않으며 비용과 실패를 늘릴 수 있음을 평가했다. - OpenAI 문서는 Codex가 작업 전 AGENTS.md를 읽고 프로젝트 지침을 계층화한다고 설명한다. - 정책 파일은 에이전트 지침을 코드 리뷰 가능한 위치에 두지만, 실제 통제는 샌드박스, 권한, 승인, 검증 명령과 함께 작동해야 한다. 추천: AGENTS.md는 짧고 구체적인 프로젝트 규칙과 검증 명령만 담아라. 민감 작업은 파일 지침이 아니라 권한 제한과 사람 승인으로 막아야 한다. 출처 목록: - (주근거) Evaluating AGENTS.md — https://arxiv.org/abs/2602.11988 - (보조근거) Custom instructions with AGENTS.md — https://developers.openai.com/codex/guides/agents-md - (보조근거) How to write a great agents.md — https://github.blog/ai-and-ml/github-copilot/how-to-write-a-great-agents-md-lessons-from-over-2500-repositories/ --- ## NIST AI Agent Standards Initiative는 에이전트 표준 논의를 공공 의제로 올렸다 - URL: https://stkradar.com/articles/nist-ai-agent-standards-initiative/ - 판정: 채택 (영향도 83/100) - 이벤트: 2026-02-17 - 분류: 프레임워크 · NIST - 출처: 2개 (주근거 1) NIST의 AI Agent Standards Initiative는 법적 강제 준수 규칙이 아니라 상호운용성, 보안, identity, open protocol 논의를 촉진하는 표준 이니셔티브다. 정부 출처라는 점은 중요하지만, 지금 당장 의무 규제처럼 읽으면 안 된다. 핵심 요약: - NIST는 2026-02-17 AI Agent Standards Initiative 출범을 발표했다. - 이니셔티브는 업계 주도 표준, 커뮤니티 주도 공개 프로토콜, 에이전트 보안과 identity 연구를 세 축으로 제시한다. - 에이전트 상호운용성과 보안이 제품 기능 문제가 아니라 표준과 신뢰 인프라 문제로 다뤄지기 시작했다. 추천: 에이전트 제품의 보안·상호운용성 로드맵에 채택하라. 다만 고객 문서에는 의무 규제가 아니라 표준 논의와 공공 입력 절차로 표현해야 한다. 출처 목록: - (주근거) Announcing the AI Agent Standards Initiative for Interoperable and Secure Innovation — https://www.nist.gov/news-events/news/2026/02/announcing-ai-agent-standards-initiative-interoperable-and-secure - (보조근거) AI Agent Standards Initiative — https://www.nist.gov/artificial-intelligence/ai-agent-standards-initiative --- ## WebMCP는 웹앱이 브라우저 안에서 에이전트 도구를 노출하는 방향을 열었다 - URL: https://stkradar.com/articles/webmcp-browser-tools/ - 판정: 주시 (영향도 91/100) - 이벤트: 2026-02-10 - 분류: 프로토콜 · Chrome Developers - 출처: 2개 (주근거 1) - 토픽: Chrome Developers (https://stkradar.com/topics/chrome-developers/) WebMCP는 웹앱이 브라우저 확장 지점과 연결돼 에이전트에게 도구를 제공하는 크롬 개발자 흐름이다. 파급력은 크지만 생태계 초기 단계라 채택보다 주시가 맞다. 핵심 요약: - Chrome Developers는 2026-02-10 WebMCP와 확장 지점 논의를 공개했다. - 문서는 웹앱이 브라우저 안에서 MCP 도구를 노출하는 방식을 설명한다. - 에이전트 도구 배포 지점이 서버와 데스크톱 앱을 넘어 웹앱 자체로 확장될 수 있게 됐다. 추천: 웹 제품을 운영한다면 주시하라. 실제 구현은 브라우저 지원 범위와 사용자 권한 흐름이 더 분명해진 뒤 시작하는 편이 낫다. 출처 목록: - (주근거) WebMCP — https://developer.chrome.com/blog/webmcp-epp - (보조근거) WebMCP — https://developer.chrome.com/docs/ai/webmcp --- ## Vercel Sandbox GA는 에이전트 코드 실행을 Vercel 앱 흐름 안으로 가져왔다 - URL: https://stkradar.com/articles/vercel-sandbox-ga/ - 판정: 실험 (영향도 80/100) - 이벤트: 2026-01-30 - 분류: SDK · Vercel - 출처: 2개 (주근거 1) - 토픽: Vercel (https://stkradar.com/topics/vercel/) Vercel Sandbox 일반 제공은 비신뢰 코드와 에이전트 생성 결과를 짧게 실행하는 기반을 Vercel 생태계 안에 넣었다. Vercel 배포 팀은 Modal, E2B와 함께 실험할 만하다. 핵심 요약: - Vercel은 2026-01-30 Vercel Sandbox 일반 제공을 발표했다. - Sandbox는 비신뢰 코드, 사용자 업로드, 에이전트 생성 결과를 격리된 환경에서 실행하는 기능으로 설명된다. - Vercel 앱 안에서 코드 실행까지 이어지는 제품 경로가 더 짧아졌다. 추천: Vercel에 배포 중인 코드 에이전트 제품이면 실험하라. 지역, 비용, 파일 보존 정책은 실제 작업으로 확인해야 한다. 출처 목록: - (주근거) Run untrusted code with Vercel Sandbox, now generally available — https://vercel.com/blog/vercel-sandbox-is-now-generally-available - (보조근거) Vercel Sandboxes are now generally available — https://vercel.com/changelog/vercel-sandboxes-ga --- ## 에이전트 시대의 취향: 무엇을 버릴지 아는 사람이 이긴다 - URL: https://stkradar.com/articles/agent-era-engineering-taste/ - 판정: 주시 (영향도 84/100) - 이벤트: 2026-01-29 - 분류: 프레임워크 · arXiv - 출처: 3개 (주근거 1) - 토픽: arXiv (https://stkradar.com/topics/arxiv/) 에이전트가 코드를 빠르게 만들수록 사람의 희소한 역할은 더 많이 작성하는 것이 아니라 중복을 지우고, 기존 구조를 재사용하게 만들고, 불필요한 기능을 거절하는 일로 이동한다. 핵심 요약: - 2026-01-29 arXiv 논문은 AI 생성 PR에서 재사용 누락과 중복 코드 문제가 리뷰 감정과 함께 나타난다는 연구 근거를 제공한다. - GitHub의 에이전트 PR 리뷰 가이드는 재사용 맹점, 그럴듯한 오류, 큰 PR의 검토 부담을 실무 체크 항목으로 옮긴다. - 에이전트 시대의 리뷰는 문법 확인보다 범위 축소, 기존 코드 재사용, 삭제 판단을 더 강하게 요구한다. 추천: 에이전트 PR에는 삭제, 재사용, 범위 축소 검토 항목을 명시하라. 새 코드가 맞는지보다 이미 있는 구조를 우회했는지를 먼저 보라. 출처 목록: - (주근거) More Code, Less Reuse — https://arxiv.org/abs/2601.21276 - (보조근거) Professional Software Developers Don't Vibe, They Control — https://arxiv.org/abs/2512.14012 - (보조근거) Agent pull requests are everywhere. Here's how to review them. — https://github.blog/ai-and-ml/generative-ai/agent-pull-requests-are-everywhere-heres-how-to-review-them/ --- ## MCP Apps는 도구 결과를 대화형 UI로 바꾸는 첫 공식 MCP 확장이다 - URL: https://stkradar.com/articles/mcp-apps-extension/ - 판정: 실험 (영향도 86/100) - 이벤트: 2026-01-26 - 분류: 프로토콜 · MCP Apps - 출처: 2개 (주근거 1) - 토픽: MCP (https://stkradar.com/topics/mcp/) MCP Apps는 도구가 일반 텍스트나 JSON만 반환하는 대신 dashboard, form, review UI 같은 대화형 컴포넌트를 샌드박스 iframe으로 렌더링하게 한다. 아직 클라이언트 지원 차이가 있어 실험 판정이지만, 에이전트 UI의 표준화 신호는 강하다. 핵심 요약: - 2026-01-26 공식 글은 MCP Apps를 첫 공식 MCP 확장이자 운영 투입 가능 기능으로 발표했다. - 도구 메타데이터의 ui resourceUri와 ui:// resource가 호스트 iframe 렌더링, postMessage JSON-RPC, 모델 컨텍스트 갱신을 연결한다. - 공식 글은 Claude, Goose, VS Code Insiders, ChatGPT 지원을 언급하며 클라이언트 표면 확장을 보여준다. 추천: MCP 서버가 결과 검토, 설정, 데이터 탐색 UI를 필요로 한다면 시제품을 만들되, 대체 텍스트 출력과 호스트별 기능 확인을 함께 설계하라. 출처 목록: - (주근거) MCP Apps - Bringing UI Capabilities To MCP Clients — https://blog.modelcontextprotocol.io/posts/2026-01-26-mcp-apps/ - (보조근거) MCP Apps Overview — https://modelcontextprotocol.io/extensions/apps/overview --- ## APEX Agents는 전문직 장기 멀티앱 업무 자동화 주장에 현실성 검사를 요구한다 - URL: https://stkradar.com/articles/apex-agents-professional-work-benchmark/ - 판정: 주시 (영향도 88/100) - 이벤트: 2026-01-20 - 분류: 평가 · arXiv - 출처: 2개 (주근거 1) - 토픽: arXiv (https://stkradar.com/topics/arxiv/) APEX Agents는 투자은행, 컨설팅, 법무 같은 전문 업무에서 긴 멀티앱 과제를 평가한다. 모든 사무 자동화를 대표한다고 일반화하기보다, 고가 전문 업무를 에이전트가 실제로 어디까지 다룰 수 있는지 보는 현실성 검사로 써야 한다. 핵심 요약: - APEX Agents 논문은 2026-01-20 제출되어 전문 서비스 업무의 장기 멀티앱 과제를 평가 대상으로 제시했다. - 데이터셋은 투자은행, 컨설팅, 법무식 과제처럼 자료 해석, 문서 작성, 여러 앱 사용이 얽힌 업무를 다룬다. - 전문 업무 자동화 주장은 단순 브라우저 조작이나 문서 요약 점수가 아니라 긴 작업 완성도와 검토 가능성으로 따져야 한다. 추천: 전문 서비스 자동화 제품을 평가할 때 참고하라. 단, 내부 업무의 검토 기준, 책임 소재, 자료 반출 정책을 별도 기준으로 두고 점수를 해석해야 한다. 출처 목록: - (주근거) APEX Agents: A Benchmark for Evaluating Autonomous Agents on Complex Professional Work — https://arxiv.org/abs/2601.14242 - (보조근거) mercor/apex-agents — https://huggingface.co/datasets/mercor/apex-agents --- ## Mastra 1.0은 TypeScript agent framework의 production API 고정 신호다 - URL: https://stkradar.com/articles/mastra-1-stable/ - 판정: 실험 (영향도 75/100) - 이벤트: 2026-01-20 - 분류: 프레임워크 · Mastra - 출처: 2개 (주근거 1) Mastra 1.0 stable은 서버 어댑터, 복합 저장소, AI SDK v6 지원, 스레드 복제, 통합 관측성 스키마를 묶었다. TypeScript 빌더에게 매력적이지만, LangGraph/Vercel AI SDK와 역할을 분리해 실험해야 한다. 핵심 요약: - Mastra는 2026-01-20 1.0 stable 릴리즈를 발표하며 API 고정 상태를 명시했다. - 서버 어댑터는 Express, Hono, Fastify, Koa 앱 안에 에이전트/작업 흐름/도구/MCP 서버 엔드포인트를 등록하는 방향이다. - 복합 저장소와 통합 관측성 스키마는 메모리, 작업 흐름, 점수, 관측성을 도메인별로 분리하는 생산형 설계를 보여준다. 추천: TypeScript 중심 에이전트 실행 환경이 필요하면 작은 작업 흐름으로 실험하고, 저장소/관측성 도메인 분리가 실제 운영 비용을 낮추는지 먼저 검증하라. 출처 목록: - (주근거) Announcing Mastra 1.0! — https://mastra.ai/blog/announcing-mastra-1 - (보조근거) mastra-ai/mastra releases — https://github.com/mastra-ai/mastra/releases --- ## Vercel AI SDK 6는 TypeScript 앱 안의 Agent 추상화를 실전 표면으로 만들었다 - URL: https://stkradar.com/articles/vercel-ai-sdk-6-agents/ - 판정: 채택 (영향도 88/100) - 이벤트: 2025-12-22 - 분류: SDK · Vercel - 출처: 2개 (주근거 1) - 토픽: Vercel (https://stkradar.com/topics/vercel/) AI SDK 6는 ToolLoopAgent, MCP OAuth/리소스/프롬프트/입력 요청, DevTools, UI 스트리밍을 TypeScript 앱 흐름 안에 묶었다. Next.js와 Vercel 기반 개인 개발자에게는 LangGraph급 실행 환경보다 가볍게 에이전트 UI를 붙이는 채택 후보가 됐다. 핵심 요약: - AI SDK 6 릴리즈는 Agent 계열 API와 ToolLoopAgent를 앱 개발 표면으로 올렸다. - MCP 지원은 OAuth 인증, 리소스, 프롬프트, 입력 요청까지 확장되었다. - 구조화 출력과 다단계 도구 루프가 통합되어 TypeScript 앱에서 에이전트 응답과 UI 스트리밍을 더 쉽게 묶는다. 추천: 웹앱 UI와 에이전트 스트리밍이 핵심인 TypeScript 제품은 AI SDK 6를 기본 후보로 두고, 장기 영속성과 다중 에이전트 그래프가 필요해질 때 LangGraph/Mastra로 확장하라. 출처 목록: - (주근거) AI SDK 6 — https://vercel.com/blog/ai-sdk-6 - (보조근거) Agents Overview - AI SDK — https://ai-sdk.dev/docs/agents/overview --- ## Gemini Interactions API는 모델 호출과 관리형 에이전트를 한 표면으로 묶기 시작했다 - URL: https://stkradar.com/articles/google-gemini-interactions-api/ - 판정: 실험 (영향도 82/100) - 이벤트: 2025-12-11 - 분류: SDK · Google - 출처: 2개 (주근거 1) - 토픽: Google (https://stkradar.com/topics/google/) Google의 Interactions API는 Gemini 모델 호출, 관리형 에이전트 호출, 서버 측 상태, 백그라운드 실행, MCP 도구 연결을 하나의 상호작용 표면으로 모으려는 공개 베타 신호다. 아직 기본 스택으로 고정하기보다 작은 실험으로 검증할 단계다. 핵심 요약: - Google은 2025-12-11 Interactions API를 Google AI Studio의 Gemini API 공개 베타로 소개했다. - 단일 REST 엔드포인트에서 model 또는 agent 매개변수로 Gemini 모델과 Gemini Deep Research 같은 관리형 에이전트를 호출하는 방향을 제시한다. - 서버 측 상태, 복합 메시지와 도구 결과 스키마, 백그라운드 실행, 원격 MCP 도구 지원이 에이전트 앱의 기본 요구로 올라왔다. 추천: Gemini 중심 제품은 작은 내부 에이전트부터 실험하라. 기본 실행 계층으로 고정하기 전에는 상태 보관, 장기 실행 실패, 비용, API 변경 가능성을 따로 검증해야 한다. 출처 목록: - (주근거) Interactions API: A unified foundation for models and agents — https://blog.google/innovation-and-ai/technology/developers-tools/interactions-api/ - (보조근거) Building agents with the ADK and the new Interactions API — https://developers.googleblog.com/building-agents-with-the-adk-and-the-new-interactions-api/ --- ## OWASP Agentic Top 10 2026은 에이전트 보안을 별도 위험 목록으로 정리했다 - URL: https://stkradar.com/articles/owasp-agentic-top10-2026/ - 판정: 채택 (영향도 90/100) - 이벤트: 2025-12-09 - 분류: 프레임워크 · OWASP - 출처: 2개 (주근거 1) OWASP Agentic Top 10 for 2026은 에이전트 애플리케이션에서 반복되는 보안 위험을 별도 목록으로 정리한 기준이다. 보안 검토 체크리스트를 만드는 팀에는 채택할 만한 공통 언어다. 핵심 요약: - OWASP는 2025-12-09 Agentic Applications Top 10 for 2026 자료를 공개했다. - Agentic Security Initiative 페이지는 에이전트 보안 논의의 배경과 활동을 보조한다. - 에이전트 보안이 일반 생성형 AI 위험의 부록이 아니라 별도 점검 항목으로 분리됐다. 추천: 에이전트 제품을 검토한다면 채택하라. 기존 애플리케이션 보안 점검에 도구 권한, 자동 실행, 외부 입력 항목을 추가해야 한다. 출처 목록: - (주근거) OWASP Top 10 for Agentic Applications for 2026 — https://genai.owasp.org/resource/owasp-top-10-for-agentic-applications-for-2026/ - (보조근거) Agentic Security Initiative — https://genai.owasp.org/initiatives/agentic-security-initiative/ --- ## 운영의 첫 화면이 바뀐다: 대시보드보다 에이전트에게 먼저 묻는다 - URL: https://stkradar.com/articles/ai-sre-agent-dashboard-shift/ - 판정: 주시 (영향도 78/100) - 이벤트: 2025-12-02 - 분류: SDK · Datadog - 출처: 4개 (주근거 1) 대시보드가 사라지는 것은 아니다. 다만 장애 대응의 첫 인터페이스가 패널 탐색에서 관측 자료를 읽는 SRE 에이전트와의 질의로 이동하는 신호가 강해지고 있다. 핵심 요약: - Datadog는 2025-12-02 Bits AI SRE Agent 출시를 발표하며 경보 이후 관측 자료를 읽고 원인 후보와 조치 제안을 만드는 흐름을 제품화했다. - 문서와 블로그는 Bits AI SRE가 Datadog 원격 측정 자료를 기반으로 조사하고 후속 질문을 받는 운영 동료 역할을 지향한다고 설명한다. - 운영자는 특정 패널을 먼저 고르는 대신 사건을 질문하고 근거, 가설, 다음 조치를 받는 방식으로 조사를 시작할 수 있다. 추천: 운영 에이전트는 자동 조치보다 읽기 전용 조사부터 도입하라. 근거 링크, 재현 가능한 조사 흔적, 사람 승인 절차가 없으면 장애 대응 권한을 넓히지 않는 편이 낫다. 출처 목록: - (주근거) Datadog Launches Bits AI SRE Agent to Resolve Incidents Faster — https://www.datadoghq.com/about/latest-news/press-releases/datadog-launches-bits-ai-sre-agent-to-resolve-incidents-faster/ - (보조근거) Introducing Bits AI SRE, your AI on-call teammate — https://www.datadoghq.com/blog/bits-ai-sre/ - (보조근거) Bits AI SRE — https://docs.datadoghq.com/bits_ai/bits_ai_sre/ - (보조근거) Datadog Bits AI SRE overview — https://betterstack.com/community/comparisons/datadog-bits-ai-sre/ --- ## Amazon Nova Act는 브라우저 조작 에이전트를 AWS 제품선 안으로 넣었다 - URL: https://stkradar.com/articles/amazon-nova-act-browser-agent/ - 판정: 실험 (영향도 83/100) - 이벤트: 2025-12-02 - 분류: SDK · AWS - 출처: 2개 (주근거 1) Amazon Nova Act는 웹 사용자 인터페이스 작업을 모델과 도구로 수행하게 하는 AWS의 브라우저 에이전트 SDK다. AWS 계정과 보안 경계 안에서 브라우저 자동화를 시험하려는 팀에 실험 가치가 있다. 핵심 요약: - AWS는 2025-12-02 Amazon Nova Act 정식 공개를 발표했다. - 사용자 안내서는 Nova Act의 목적과 브라우저 작업 자동화 방식을 설명한다. - 브라우저 에이전트 실험이 독립 도구 중심에서 대형 클라우드 제품선 안으로 들어왔다. 추천: AWS 기반 제품에서 반복 웹 작업을 줄이고 싶다면 실험하라. 결제, 계정 변경, 민감 데이터 입력은 사람 승인 단계를 유지해야 한다. 출처 목록: - (주근거) Build reliable AI agents for UI workflow automation with Amazon Nova Act — https://aws.amazon.com/blogs/aws/build-reliable-ai-agents-for-ui-workflow-automation-with-amazon-nova-act-now-generally-available/ - (보조근거) What is Amazon Nova Act? — https://docs.aws.amazon.com/nova-act/latest/userguide/what-is-nova-act.html --- ## MCP 2025-11-25는 tasks, elicitation, authorization을 운영 기준으로 올렸다 - URL: https://stkradar.com/articles/mcp-2025-11-operational-release/ - 판정: 채택 (영향도 89/100) - 이벤트: 2025-11-25 - 분류: 프로토콜 · MCP 스펙 - 출처: 2개 (주근거 1) - 토픽: MCP (https://stkradar.com/topics/mcp/) MCP 2025-11-25 개정판은 인증 서버 발견, 입력 요청 스키마, 샘플링 도구 호출, 실험 작업, SDK 관리 기준을 더했다. 단순 도구 호출 표준에서 장기 요청과 사용자 입력을 다루는 운영형 프로토콜로 확장된 신호다. 핵심 요약: - 2025-11-25 변경 기록은 인증 서버 발견, 점진적 범위 동의, OAuth Client ID 메타데이터를 주요 변경으로 명시한다. - URL 모드 입력 요청과 단일/다중 선택 enum schema는 도구 실행 중 사용자 선택을 더 구조화한다. - 실험 작업은 지속 요청 추적, 주기적 조회, 지연 결과 회수를 위한 공식 실험 축으로 올라왔다. 추천: 새 MCP 서버를 설계한다면 2025-11-25의 인증, 입력 요청, 도구 이름 지침을 기본 기준으로 삼고, 작업은 호스트/클라이언트 지원 범위를 확인하며 제한적으로 실험하라. 출처 목록: - (주근거) Key Changes - Model Context Protocol 2025-11-25 — https://modelcontextprotocol.io/specification/2025-11-25/changelog - (보조근거) Elicitation - Model Context Protocol 2025-11-25 — https://modelcontextprotocol.io/specification/2025-11-25/client/elicitation --- ## Google Antigravity는 코딩 에이전트 경쟁을 개발 표면 전체로 넓혔다 - URL: https://stkradar.com/articles/google-antigravity-agentic-dev-platform/ - 판정: 주시 (영향도 86/100) - 이벤트: 2025-11-18 - 분류: 프레임워크 · Google - 출처: 2개 (주근거 1) - 토픽: Google (https://stkradar.com/topics/google/) Google Antigravity는 코딩 에이전트를 명령줄 도구가 아니라 편집기, 관리자 화면, 브라우저, 터미널이 연결된 개발 표면으로 제시했다. Gemini CLI나 Interactions API와 달리 개발자가 실제로 일하는 화면 전체를 재편하려는 신호다. 핵심 요약: - Google은 2025-11-18 Gemini 3 발표에서 Antigravity를 Gemini 3을 쓰는 개발 표면으로 함께 공개했다. - 이후 개발자 블로그는 편집기, 관리자 화면, 브라우저, 터미널을 묶어 에이전트 작업을 관리하는 구조를 설명했다. - 코딩 에이전트 경쟁축이 단순 CLI 호출에서 작업 계획, 실행 상태, 검토 화면까지 포함하는 개발 환경 경쟁으로 이동했다. 추천: Google 중심 개발 도구를 쓰는 팀은 주시하라. 다만 기존 편집기와 CI 검토 흐름을 바로 대체하기보다, 에이전트 감독 화면과 브라우저 확인 기능이 실제 작업 시간을 줄이는지 먼저 검증해야 한다. 출처 목록: - (주근거) Gemini 3 — https://blog.google/products-and-platforms/products/gemini/gemini-3/ - (보조근거) Build with Google Antigravity, our new agentic development platform — https://developers.googleblog.com/build-with-google-antigravity-our-new-agentic-development-platform/ --- ## Terminal-Bench 2는 터미널 에이전트 평가를 더 현실적인 작업군으로 넓혔다 - URL: https://stkradar.com/articles/terminal-bench-2/ - 판정: 채택 (영향도 87/100) - 이벤트: 2025-11-07 - 분류: 평가 · Snorkel AI - 출처: 3개 (주근거 1) Terminal-Bench 2는 셸과 파일 시스템을 다루는 에이전트 평가를 실제 개발·운영 작업에 더 가깝게 확장한 벤치마크다. 터미널형 에이전트를 비교하는 팀에는 채택할 기준 후보가 됐다. 핵심 요약: - Snorkel AI 글은 2025-11-07 Terminal-Bench 2 공개와 주요 변화를 설명한다. - Terminal-Bench 저장소는 터미널 작업 평가 세트를 제공한다. - 코딩 에이전트 평가는 대화 점수보다 실제 셸 작업 성공률을 더 중요하게 보게 됐다. 추천: 터미널형 에이전트를 비교한다면 채택하라. 공개 작업군 점수만 보지 말고 내부 명령 정책에 맞춘 작업을 추가해야 한다. 출처 목록: - (주근거) Terminal-Bench 2.0: Raising the bar for AI agent evaluation — https://snorkel.ai/blog/terminal-bench-2-0-raising-the-bar-for-ai-agent-evaluation/ - (보조근거) terminal-bench — https://github.com/harbor-framework/terminal-bench - (보조근거) Terminal-Bench 2 — https://openreview.net/forum?id=a7Qa4CcHak --- ## Langfuse for Agents는 에이전트 실행 추적을 평가의 앞단으로 끌어왔다 - URL: https://stkradar.com/articles/langfuse-for-agents-observability/ - 판정: 실험 (영향도 78/100) - 이벤트: 2025-11-05 - 분류: 평가 · Langfuse - 출처: 2개 (주근거 1) Langfuse for Agents는 도구 호출, trace log view, observation types, agent graphs를 통해 에이전트 실행을 더 잘 훑고 평가할 수 있게 한 2025-11-05 기능 묶음이다. v4 전체 GA로 과장하기보다, 에이전트 추적 기능 강화와 이후 미리보기 흐름으로 보는 편이 안전하다. 핵심 요약: - Langfuse는 2025-11-05 Langfuse for Agents 변경 기록을 공개했다. - 도구 목록과 호출 인수, 전체 추적 로그 보기, 관찰 유형, 에이전트 그래프가 복잡한 실행을 살피는 기본 화면으로 제시됐다. - 평가는 점수 계산만이 아니라 어떤 도구가 왜 선택됐고 어디서 반복됐는지 보는 실행 가시성과 결합되고 있다. 추천: 도구 호출이 많은 에이전트는 실험하라. 최종 응답 평가만 저장하는 팀은 먼저 추적 로그와 실패 재현 기준을 정해야 한다. 출처 목록: - (주근거) Langfuse for Agents — https://langfuse.com/changelog/2025-11-05-langfuse-for-agents - (커뮤니티신호) Langfuse v4 preview discussion — https://github.com/orgs/langfuse/discussions/12518 --- ## OpenHands Software Agent SDK는 연구용 에이전트 구성 요소를 제품 코드 쪽으로 끌어왔다 - URL: https://stkradar.com/articles/openhands-software-agent-sdk/ - 판정: 실험 (영향도 88/100) - 이벤트: 2025-11-05 - 분류: SDK · OpenHands - 출처: 2개 (주근거 1) OpenHands Software Agent SDK는 코드 작성 에이전트에 필요한 상태, 도구, 실행 제어를 재사용 가능한 파이썬 구성 요소로 정리하려는 시도다. 연구 기반 SDK이므로 실제 제품에는 좁은 범위 실험부터 맞다. 핵심 요약: - arXiv 논문은 2025-11-05 Software Agent SDK를 공개 연구 산출물로 제시했다. - GitHub 저장소는 OpenHands 에이전트 구성 요소를 별도 패키지로 제공하는 흐름을 보조한다. - 코딩 에이전트 구현은 완성 앱보다 재사용 가능한 상태, 도구, 실행 제어 묶음으로 분해되는 방향이 강해졌다. 추천: 코딩 에이전트 내부 구조를 배우거나 좁은 기능을 실험할 때만 도입하고, 핵심 제품 경로는 별도 안정성 검사를 거쳐야 한다. 출처 목록: - (주근거) OpenHands Software Agent SDK — https://arxiv.org/abs/2511.03690 - (보조근거) OpenHands Software Agent SDK — https://github.com/OpenHands/software-agent-sdk --- ## Rule of Two는 에이전트 보안 설계를 현실적인 분리 원칙으로 낮췄다 - URL: https://stkradar.com/articles/agents-rule-of-two-security-framework/ - 판정: 채택 (영향도 80/100) - 이벤트: 2025-10-31 - 분류: 프레임워크 · Meta - 출처: 2개 (주근거 1) Meta의 Rule of Two는 신뢰할 수 없는 입력, 비공개 데이터, 외부 행동 세 가지를 한 에이전트 세션에 모두 묶지 말라는 실용 보안 프레임워크다. 프롬프트 주입이 해결됐다는 뜻이 아니라 위험 조합을 줄이는 설계 원칙이다. 핵심 요약: - Meta는 2025-10-31 Practical AI Agent Security 글에서 Rule of Two를 제시했다. - 원칙은 신뢰할 수 없는 입력, 비공개 데이터, 외부 행동 중 세 요소를 모두 한 세션에 묶지 않도록 설계하라고 말한다. - 에이전트 보안 논의가 모델 방어 하나에서 데이터 흐름과 행동 권한 분리 설계로 내려왔다. 추천: 비공개 데이터와 외부 행동을 함께 다루는 에이전트에는 기본 설계 원칙으로 채택하라. 신뢰할 수 없는 웹 입력을 읽는 세션과 쓰기 권한 세션을 분리하는 것부터 시작해야 한다. 출처 목록: - (주근거) Practical AI Agent Security — https://ai.meta.com/blog/practical-ai-agent-security/ - (보조근거) Practical AI Agent Security — https://arxiv.org/abs/2510.09023 --- ## Stagehand v3는 브라우저 에이전트를 Playwright 스크립트와 블랙박스 사이에 세웠다 - URL: https://stkradar.com/articles/stagehand-v3-browser-agents/ - 판정: 실험 (영향도 78/100) - 이벤트: 2025-10-29 - 분류: 프레임워크 · Browserbase - 출처: 2개 (주근거 1) Stagehand v3는 Playwright 의존성을 제거하고 CDP 기반 모듈형 드라이버, 토큰 인식 컨텍스트 빌더, 브라우저 에이전트 관측성을 강조했다. API 없는 웹 업무를 자동화하는 개인 개발자에게 유용하지만 인증/captcha/세션 문제는 여전히 별도 과제다. 핵심 요약: - Browserbase는 2025-10-29 Stagehand v3를 발표하며 CDP 기반 재작성과 모듈형 드라이버 시스템을 설명했다. - v3는 Puppeteer, Playwright, Bun 등 드라이버 이식성과 iframe/shadow DOM 신뢰성을 강조한다. - 공식 글은 상세 관측성과 작업별 토큰 단위 보고를 디버깅/비용 최적화 근거로 제시한다. 추천: API 없는 반복 업무에는 결정적 Playwright를 먼저 쓰고, DOM 변화와 데이터 추출이 많은 부분에 Stagehand를 제한적으로 붙여 실행 추적/재현 비용을 측정하라. 출처 목록: - (주근거) Launching Stagehand v3, the best automation framework — https://www.browserbase.com/blog/stagehand-v3 - (보조근거) Stagehand Quickstart — https://docs.browserbase.com/welcome/quickstarts/stagehand --- ## LangSmith 멀티턴 평가는 에이전트 품질 판단을 단일 실행 기록에서 전체 대화로 옮겼다 - URL: https://stkradar.com/articles/langsmith-multiturn-evals/ - 판정: 채택 (영향도 82/100) - 이벤트: 2025-10-23 - 분류: 평가 · LangSmith - 출처: 2개 (주근거 1) LangSmith Insights Agent와 멀티턴 평가는 운영 실행 기록을 사용 패턴과 전체 상호작용 점수로 바꾼다. 에이전트가 한 번 답을 잘했는지가 아니라, 사용자 목표를 전체 대화 스레드에서 달성했는지를 보는 방향이다. 핵심 요약: - 2025-10-23 LangChain 글은 Insights Agent와 멀티턴 평가 기능을 LangSmith에 출시했다고 밝혔다. - Insights Agent는 실행 기록을 분류/하위 분류로 묶어 지연 시간, 실행, 평가와 함께 탐색하게 한다. - 멀티턴 평가는 전체 대화 스레드 단위로 의미 의도, 결과, 진행 궤적을 평가한다. 추천: LangGraph/LangChain 기반 에이전트는 멀티턴 평가를 일찍 도입하고, 다른 기술 묶음은 최소한 실행 기록 ID와 대화 단위 결과 스키마를 자체적으로 설계하라. 출처 목록: - (주근거) Improve agent quality with Insights Agent and Multi-turn Evals, now in LangSmith — https://www.langchain.com/blog/insights-agent-multiturn-evals-langsmith - (보조근거) Agent Observability Powers Agent Evaluation — https://blog.langchain.com/agent-observability-powers-agent-evaluation/ --- ## LangChain 1.0 GA는 표준 에이전트 API를 안정화 기준으로 올렸다 - URL: https://stkradar.com/articles/langchain-v1-agent-api/ - 판정: 채택 (영향도 88/100) - 이벤트: 2025-10-22 - 분류: 프레임워크 · LangChain - 출처: 2개 (주근거 1) LangChain 1.0 일반 제공은 create_agent 중심의 새 에이전트 표면을 안정 버전으로 묶었다. 기존 체인 중심 사용자는 새 API와 LangGraph 기반 실행 모델을 함께 검토할 시점이다. 핵심 요약: - LangChain은 2025-10-22 LangChain 1.0 일반 제공을 발표했다. - create_agent가 LangChain 1.0의 표준 에이전트 작성 표면으로 제시됐다. - 체인 중심 API보다 에이전트, 미들웨어, LangGraph 기반 실행을 함께 보는 판단이 중요해졌다. 추천: LangChain 생태계를 계속 쓸 팀은 채택하라. 기존 체인 코드는 새 에이전트 API로 옮길 범위를 작게 잡아 검증하는 편이 좋다. 출처 목록: - (주근거) LangChain 1.0 now generally available — https://changelog.langchain.com/announcements/langchain-1-0-now-generally-available - (보조근거) What's new in LangChain v1 — https://docs.langchain.com/oss/python/releases/langchain-v1 --- ## LangGraph 1.0 GA는 장기 실행 에이전트의 지속 상태를 제품 기준으로 올렸다 - URL: https://stkradar.com/articles/langgraph-durable/ - 판정: 채택 (영향도 88/100) - 이벤트: 2025-10-22 - 분류: 프레임워크 · LangGraph - 출처: 2개 (주근거 1) LangGraph 1.0 GA는 사람 승인 개입, 중단 후 재개, 상태 체크포인트가 필요한 에이전트 작업 흐름에서 명시적 그래프와 내장 상태 저장이 운영 리스크를 낮춘다는 신호다. 핵심 요약: - 2025-10-22 LangGraph 1.0 GA는 에이전트가 한 번에 끝나는 도구 호출에서 며칠 뒤 재개되는 작업 흐름으로 넘어가는 신호다. - LangGraph 상태 저장은 체크포인터와 스레드 ID로 중단/재개 시나리오를 전면에 둔다. - 부수 효과를 작업으로 감싸 재실행 시 중복 실행을 피하는 설계가 중요해진다. 추천: 긴 작업, 승인 게이트, 재시작 가능성이 있으면 채택. 단순 단발성 도구 에이전트에는 과할 수 있다. 출처 목록: - (주근거) LangGraph 1.0 is now generally available — https://changelog.langchain.com/announcements/langgraph-1-0-is-now-generally-available - (보조근거) Persistence - LangGraph — https://docs.langchain.com/oss/python/langgraph/persistence --- ## Anthropic Agent Skills는 에이전트 지식을 무한 컨텍스트가 아니라 파일 단위로 포장했다 - URL: https://stkradar.com/articles/anthropic-agent-skills/ - 판정: 채택 (영향도 83/100) - 이벤트: 2025-10-16 - 분류: SDK · Anthropic - 출처: 2개 (주근거 1) - 토픽: Anthropic (https://stkradar.com/topics/anthropic/) Agent Skills는 SKILL.md와 보조 파일을 통해 절차 지식, 스크립트, 리소스를 에이전트가 필요할 때만 읽게 하는 점진적 공개 패턴이다. Claude 생태계에서는 즉시 채택할 만하지만, skill 공급망 보안은 별도 점검이 필요하다. 핵심 요약: - Anthropic은 2025-10-16 Agent Skills를 발표하고 Claude.ai, Claude Code, Claude Agent SDK, Developer Platform 지원을 명시했다. - Skills는 메타데이터를 먼저 노출하고, 관련성이 있을 때 SKILL.md와 연결 파일을 읽는 점진적 공개 구조다. - 공식 글은 코드 실행을 포함할 수 있다고 하면서 신뢰되지 않은 skill 감사 필요를 보안 고려사항으로 제시한다. 추천: Claude/Agent SDK 기반 제품은 반복 절차와 도메인 지식을 Skills로 포장하되, 외부 skill 설치는 코드 의존성처럼 검토하고 허용 목록으로 관리하라. 출처 목록: - (주근거) Equipping agents for the real world with Agent Skills — https://www.anthropic.com/engineering/equipping-agents-for-the-real-world-with-agent-skills - (보조근거) Anthropic Skills Cookbook — https://github.com/anthropics/skills-cookbook --- ## Amazon Bedrock AgentCore GA는 에이전트 프레임워크 비교를 운영 계층 비교로 바꾼다 - URL: https://stkradar.com/articles/amazon-bedrock-agentcore-ga/ - 판정: 주시 (영향도 84/100) - 이벤트: 2025-10-13 - 분류: 프레임워크 · AWS AgentCore - 출처: 2개 (주근거 1) Amazon Bedrock AgentCore GA는 실행, 메모리, 정체성, 브라우저/코드 도구, 관측성을 관리형 운영 계층으로 묶는다. 중요도는 높지만 AWS 의존과 비용 때문에 개인 프로젝트에는 주시 판정이 맞다. 핵심 요약: - AWS는 2025-10-13 Amazon Bedrock AgentCore 일반 제공을 발표했다. - AgentCore는 실행, 메모리, 정체성, 도구, 관측성을 에이전트 운영 계층으로 묶는다. - 비교 기준이 프레임워크 API에서 관리형 실행 환경과 운영 비용으로 이동한다. 추천: AWS를 이미 쓰는 팀은 주시하면서 한 에이전트의 실행/메모리/권한 경계를 검증하라. 개인 프로젝트는 자체 호스팅 비용과 잠금 비용을 먼저 비교해야 한다. 출처 목록: - (주근거) Amazon Bedrock AgentCore is now generally available — https://aws.amazon.com/about-aws/whats-new/2025/10/amazon-bedrock-agentcore-available/ - (보조근거) Amazon Bedrock AgentCore is now generally available — https://aws.amazon.com/blogs/machine-learning/amazon-bedrock-agentcore-is-now-generally-available/ --- ## HAL은 에이전트 순위보다 평가 하네스의 신뢰성을 전면에 둔다 - URL: https://stkradar.com/articles/hal-holistic-agent-leaderboard/ - 판정: 채택 (영향도 86/100) - 이벤트: 2025-10-13 - 분류: 평가 · arXiv - 출처: 2개 (주근거 1) - 토픽: arXiv (https://stkradar.com/topics/arxiv/) Holistic Agent Leaderboard는 단순 최신 순위표가 아니라 표준화된 평가 하네스, 비용 인식, 로그 공개, 모델·스캐폴드·벤치마크 차이를 함께 보는 평가 인프라다. HAL 사이트의 업데이트 일시 중단 맥락까지 보면 최신 랭킹보다 신뢰성 점검 도구로 읽는 편이 맞다. 핵심 요약: - HAL 논문은 2025-10-13 arXiv에 제출됐다. - 논문은 수백 개 VM에서 병렬 평가를 조율하는 표준 하네스와 모델, 스캐폴드, 벤치마크의 3차원 분석을 제시한다. - 평가 로그와 비용, 스캐폴드 차이를 함께 공개해 단일 점수 경쟁의 한계를 줄이려는 방향을 보여준다. 추천: 평가 하네스 설계 기준으로 채택하라. 최신 순위표처럼 쓰기보다 로그, 비용, 스캐폴드 차이, 실패 행동을 함께 검토하는 참고 자료로 써야 한다. 출처 목록: - (주근거) Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation — https://arxiv.org/abs/2510.11977 - (보조근거) Holistic Agent Leaderboard — https://hal.cs.princeton.edu/ --- ## Gemini 2.5 Computer Use는 브라우저 조작을 모델 기능으로 끌어올렸다 - URL: https://stkradar.com/articles/google-gemini-25-computer-use-model/ - 판정: 실험 (영향도 84/100) - 이벤트: 2025-10-07 - 분류: SDK · Google - 출처: 2개 (주근거 1) - 토픽: Google (https://stkradar.com/topics/google/) Gemini 2.5 Computer Use 모델은 브라우저와 모바일 사용자 화면을 다루기 위한 computer_use 도구를 모델 API에 포함한다. Playwright, Stagehand, Nova Act 같은 자동화 계층과 달리 UI 판단 자체를 모델 제품 경계 안으로 넣은 실험 신호다. 핵심 요약: - Google DeepMind는 2025-10-07 Gemini 2.5 Computer Use 모델을 API 미리보기로 공개했다. - 문서는 모델이 화면을 보고 computer_use 도구 호출을 통해 브라우저와 모바일 UI 작업을 수행하는 방식을 설명한다. - 브라우저 자동화가 테스트 코드나 외부 제어 라이브러리만의 문제가 아니라 모델 선택 문제로도 바뀌었다. 추천: 브라우저와 모바일 UI 작업을 자동화해야 하는 팀은 작은 실험으로 시작하라. 기존 Playwright 테스트를 대체하기보다, 불안정한 웹 작업에서 모델 기반 판단이 얼마나 줄을 세우는지 별도로 측정해야 한다. 출처 목록: - (주근거) Introducing the Gemini 2.5 Computer Use model — https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-computer-use-model/ - (보조근거) Computer use — https://ai.google.dev/gemini-api/docs/computer-use --- ## OpenAI Apps SDK는 MCP 서버를 ChatGPT 안의 대화형 앱 표면으로 확장했다 - URL: https://stkradar.com/articles/openai-apps-sdk-chatgpt/ - 판정: 실험 (영향도 84/100) - 이벤트: 2025-10-06 - 분류: SDK · OpenAI - 출처: 2개 (주근거 1) - 토픽: OpenAI (https://stkradar.com/topics/openai/) 2025-10-06 OpenAI Apps SDK preview는 MCP 기반 도구에 UI와 앱 배포 표면을 붙였다. 개인 개발자에게는 잠재적 유통 채널이지만, preview, 정책 심사, 요금제/지역 제한 때문에 제품 핵심 의존은 아직 이르다. 핵심 요약: - OpenAI는 2025-10-06 Apps in ChatGPT와 Apps SDK preview를 발표했다. - 공식 글은 Apps SDK가 MCP를 기반으로 로직과 인터페이스를 함께 설계하게 한다고 설명한다. - Help Center는 개발자 모드, 백엔드 연결, 개인정보 처리방침, 앱 디렉터리 제출 같은 운영 조건을 명시한다. 추천: ChatGPT 내부에서 쓰일 수 있는 도구형 제품이라면 작게 실험하되, 독립 웹앱과 MCP 대체 경로를 유지해 OpenAI 채널 종속을 낮춰라. 출처 목록: - (주근거) Introducing apps in ChatGPT and the new Apps SDK — https://openai.com/index/introducing-apps-in-chatgpt/ - (보조근거) Build with the Apps SDK — https://help.openai.com/en/articles/12515353-build-with-the-apps-sdk --- ## GitHub Copilot coding agent 정식 공개는 저장소 작업 위임을 기본 선택지로 올렸다 - URL: https://stkradar.com/articles/github-copilot-coding-agent-ga/ - 판정: 채택 (영향도 88/100) - 이벤트: 2025-09-25 - 분류: 프레임워크 · GitHub - 출처: 2개 (주근거 1) - 토픽: GitHub (https://stkradar.com/topics/github/) GitHub Copilot coding agent는 이슈를 맡아 분기, 코드 변경, 풀 리퀘스트 제안까지 이어지는 저장소 작업 대행 기능이다. GitHub 중심 팀에는 별도 연결보다 채택 판단이 빠른 후보가 됐다. 핵심 요약: - GitHub는 2025-09-25 Copilot coding agent 정식 공개를 알렸다. - 공식 문서는 클라우드 에이전트가 이슈를 받아 작업하고 풀 리퀘스트로 결과를 제안하는 방식을 설명한다. - 저장소 안 작업 대행이 별도 도구 실험에서 GitHub 제품 안의 정식 기능으로 이동했다. 추천: GitHub 이슈와 풀 리퀘스트로 개발을 관리한다면 채택하라. 다만 민감 저장소 권한과 외부 시스템 변경 범위는 별도 정책으로 제한해야 한다. 출처 목록: - (주근거) Copilot coding agent is now generally available — https://github.blog/changelog/2025-09-25-copilot-coding-agent-is-now-generally-available/ - (보조근거) About Copilot coding agent — https://docs.github.com/en/copilot/concepts/agents/cloud-agent/about-cloud-agent --- ## Chrome DevTools MCP는 브라우저 진단을 에이전트 도구 경계 안으로 넣었다 - URL: https://stkradar.com/articles/chrome-devtools-mcp/ - 판정: 채택 (영향도 86/100) - 이벤트: 2025-09-23 - 분류: 프로토콜 · Chrome Developers - 출처: 2개 (주근거 1) - 토픽: Chrome Developers (https://stkradar.com/topics/chrome-developers/) Chrome DevTools MCP는 성능, 콘솔, 네트워크 같은 브라우저 진단 기능을 MCP 서버로 제공한다. 웹앱 품질을 자동 점검하려는 팀에는 채택 후보가 뚜렷하다. 핵심 요약: - Chrome Developers는 2025-09-23 Chrome DevTools MCP를 발표했다. - GitHub 저장소는 DevTools 기능을 MCP 서버로 노출하는 구현을 제공한다. - 브라우저 문제 재현과 진단이 사람의 개발자도구 조작에서 에이전트가 호출하는 도구로 이동할 수 있게 됐다. 추천: 웹앱을 에이전트로 점검한다면 채택하라. 다만 사용자 세션과 민감 요청을 다루는 권한 경계는 별도 정책으로 묶어야 한다. 출처 목록: - (주근거) Chrome DevTools MCP — https://developer.chrome.com/blog/chrome-devtools-mcp - (보조근거) chrome-devtools-mcp — https://github.com/ChromeDevTools/chrome-devtools-mcp --- ## SWE-bench Pro는 코딩 에이전트 평가 난도를 다시 끌어올렸다 - URL: https://stkradar.com/articles/swe-bench-pro-benchmark-shift/ - 판정: 채택 (영향도 86/100) - 이벤트: 2025-09-19 - 분류: 평가 · Scale AI - 출처: 2개 (주근거 1) SWE-bench Pro는 기존 SWE-bench 계열보다 더 어려운 소프트웨어 작업 평가를 제시한다. 코딩 에이전트 성능 비교가 포화된 뒤 새로운 난도 기준을 찾는 팀에는 중요한 채택 후보가 됐다. 핵심 요약: - Scale AI는 2025-09-19 SWE-bench Pro 글을 공개했다. - OpenAI 글은 기존 SWE-bench Verified 평가 사용 중단 이유를 설명하며 평가 포화 문제를 보조한다. - 코딩 에이전트 평가는 기존 공개 과제 점수 경쟁에서 더 어려운 실제형 과제로 이동하고 있다. 추천: 코딩 에이전트 성능을 비교한다면 채택하라. 단일 점수보다 과제 유형, 실패 원인, 검토 비용을 함께 봐야 한다. 출처 목록: - (주근거) Introducing SWE-bench Pro — https://scale.com/blog/swe-bench-pro - (보조근거) Why we no longer evaluate on SWE-bench Verified — https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/ --- ## MCP Registry 프리뷰는 서버 발견 문제를 공식 인프라 문제로 끌어올렸다 - URL: https://stkradar.com/articles/mcp-registry-preview/ - 판정: 주시 (영향도 79/100) - 이벤트: 2025-09-08 - 분류: 프로토콜 · MCP Registry - 출처: 2개 (주근거 1) - 토픽: MCP (https://stkradar.com/topics/mcp/) MCP Registry preview는 공개 MCP 서버를 찾고 배포 메타데이터를 표준화하는 상위 목록 역할을 시작했다. 서버 품질을 보장하는 마켓이 아니라, 하위 registry와 클라이언트가 기준 데이터로 삼는 발견 계층이다. 핵심 요약: - 2025-09-08 공식 블로그는 MCP Registry preview를 공개 MCP 서버 목록과 API로 발표했다. - registry는 서버 코드 호스팅이 아니라 서버 메타데이터, 패키지 설명자, OpenAPI schema를 중심으로 한다. - 공식 글은 공개/비공개 하위 registry가 상위 registry 위에서 각자 필터와 UX를 얹을 수 있다고 설명한다. 추천: MCP 서버를 공개 배포할 계획이면 registry 메타데이터를 맞춰두되, 발견 UX와 조정 정책은 아직 클라이언트별 차이가 크므로 제품 핵심 유입 채널로 단정하지 말라. 출처 목록: - (주근거) Introducing the MCP Registry — https://blog.modelcontextprotocol.io/posts/2025-09-08-mcp-registry-preview/ - (보조근거) modelcontextprotocol/registry — https://github.com/modelcontextprotocol/registry --- ## Cloudflare Signed Agents는 봇 인증을 선언이 아니라 서명 검증 문제로 바꿨다 - URL: https://stkradar.com/articles/cloudflare-signed-agents-web-bot-auth/ - 판정: 채택 (영향도 87/100) - 이벤트: 2025-08-28 - 분류: 프로토콜 · Cloudflare - 출처: 2개 (주근거 1) - 토픽: Cloudflare (https://stkradar.com/topics/cloudflare/) Cloudflare Signed Agents는 웹사이트가 자동 방문자의 신원을 암호 서명으로 확인하도록 돕는 방식이다. 에이전트 접근을 막거나 허용해야 하는 사이트 운영자에게 중요한 프로토콜 신호다. 핵심 요약: - Cloudflare는 2025-08-28 Signed Agents 발표를 공개했다. - 개발자 문서는 서명된 에이전트가 봇 관리 안에서 식별되는 방식을 설명한다. - 자동 방문자 식별이 사용자 에이전트 문자열이나 선언보다 검증 가능한 신원 문제로 이동했다. 추천: 공개 웹서비스를 운영한다면 채택 관점으로 검토하라. 서명 발급자 신뢰, 차단 정책, 예외 처리 기준을 함께 정해야 한다. 출처 목록: - (주근거) Signed Agents — https://blog.cloudflare.com/signed-agents/ - (보조근거) Signed agents — https://developers.cloudflare.com/bots/concepts/bot/signed-agents/ --- ## Agent Client Protocol은 편집기와 에이전트 사이의 교체 가능한 경계를 제안했다 - URL: https://stkradar.com/articles/agent-client-protocol/ - 판정: 실험 (영향도 82/100) - 이벤트: 2025-08-27 - 분류: 프로토콜 · Zed - 출처: 2개 (주근거 1) Agent Client Protocol은 Zed가 편집기와 외부 에이전트 사이의 연결 방식을 표준화하려는 시도다. 편집기 안 에이전트 선택권을 넓히지만, 아직은 실험적 통합 기준으로 보는 편이 맞다. 핵심 요약: - Zed는 2025-08-27 외부 에이전트를 Zed에 연결하는 글을 공개했다. - Agent Client Protocol 저장소는 편집기와 에이전트 사이의 메시지 경계를 정의한다. - 편집기 에이전트 경쟁은 단일 내장 기능보다 교체 가능한 연결 규약 경쟁으로 이동할 수 있다. 추천: 편집기 에이전트 제품을 만들거나 Zed 통합이 필요하면 실험하라. 범용 표준으로 보기 전에는 다른 편집기 지원을 확인해야 한다. 출처 목록: - (주근거) Bring your own agent to Zed — https://zed.dev/blog/bring-your-own-agent-to-zed - (보조근거) agent-client-protocol — https://github.com/agentclientprotocol/agent-client-protocol --- ## Playwright MCP는 브라우저 자동화 에이전트의 실용 기준점이 됐다 - URL: https://stkradar.com/articles/microsoft-playwright-mcp-browser-automation/ - 판정: 채택 (영향도 81/100) - 이벤트: 2025-08-07 - 분류: 프로토콜 · Microsoft - 출처: 2개 (주근거 1) - 토픽: Microsoft (https://stkradar.com/topics/microsoft/) Microsoft의 Playwright MCP는 접근성 트리와 브라우저 상태를 MCP 서버로 제공해 에이전트가 웹 페이지를 다루게 한다. Chrome DevTools MCP가 진단 도구에 가깝다면, Playwright MCP는 테스트와 사용자 흐름 실행을 연결하는 채택 가능한 기준점이다. 핵심 요약: - Microsoft 개발자 블로그는 2025-08-07 Playwright의 도구, AI, 실제 작업 흐름을 묶어 설명하면서 Playwright MCP를 소개했다. - 저장소는 브라우저 상태와 접근성 트리 중심으로 에이전트가 페이지를 탐색하고 조작하는 MCP 서버 구현을 제공한다. - 브라우저 자동화가 테스트 스크립트뿐 아니라 에이전트 도구 표준의 한 축으로 자리 잡았다. 추천: 웹앱 에이전트나 브라우저 기반 검증을 만들면 채택하라. 다만 로그인 세션, 결제, 삭제 같은 외부 행동은 별도 승인 경계와 기록을 붙여야 한다. 출처 목록: - (주근거) The complete Playwright end-to-end story: tools, AI, and real-world workflows — https://developer.microsoft.com/blog/the-complete-playwright-end-to-end-story-tools-ai-and-real-world-workflows - (보조근거) microsoft/playwright-mcp — https://github.com/microsoft/playwright-mcp --- ## Temporal의 OpenAI Agents SDK 통합은 에이전트 실행을 내구 작업으로 바꾼다 - URL: https://stkradar.com/articles/temporal-openai-agents-durable/ - 판정: 주시 (영향도 82/100) - 이벤트: 2025-07-30 - 분류: 프레임워크 · Temporal - 출처: 2개 (주근거 1) Temporal은 OpenAI Agents SDK 실행을 재시도, 장애 복구, 실행 이력 안으로 넣는다. 모델 호출보다 업무 완료 보장이 중요한 제품에서는 프레임워크 선택보다 지속 실행 계층 선택이 더 중요해진다. 핵심 요약: - Temporal은 2025-07-30 OpenAI Agents SDK 통합을 발표했다. - 통합은 에이전트 실행을 Temporal 작업 안에 넣어 재시도, 장애 복구, 실행 이력을 제공하는 방향이다. - 장기 작업과 외부 시스템 변경이 섞이면 에이전트 프레임워크보다 내구 실행 보장이 먼저 문제가 된다. 추천: 실패 복구와 이력이 중요한 에이전트 업무라면 주시하면서 작은 승인 작업으로 검증하라. 단순 챗봇에는 과한 운영 계층일 수 있다. 출처 목록: - (주근거) Announcing OpenAI Agents SDK integration — https://temporal.io/blog/announcing-openai-agents-sdk-integration - (보조근거) OpenAI Agents SDK Integration — https://temporal.io/changelog/open-ai-agents-sdk-integration-pp --- ## OSWorld-Verified는 컴퓨터 사용 평가의 과제 품질 문제를 드러냈다 - URL: https://stkradar.com/articles/osworld-verified-computer-use-benchmark/ - 판정: 채택 (영향도 84/100) - 이벤트: 2025-07-28 - 분류: 평가 · OSWorld - 출처: 2개 (주근거 1) OSWorld-Verified는 특정 에이전트가 검증됐다는 뜻이 아니라 OSWorld 벤치마크의 과제, 평가 함수, 실행 인프라를 정비한 신호다. 컴퓨터 사용 평가에서는 모델 점수만큼 과제 품질과 실행 안정성이 중요해졌다. 핵심 요약: - XLANG Lab은 2025-07-28 OSWorld-Verified를 소개했다. - 업데이트는 AWS 기반 병렬 실행, 300개 이상 문제 수정, 공개 평가 플랫폼, 과제 품질 정비를 강조한다. - 웹 구조 변화, CAPTCHA, 지리적 차단, 모호한 지시, 평가 함수 취약성이 컴퓨터 사용 벤치마크의 핵심 리스크로 드러났다. 추천: 컴퓨터 사용 에이전트 평가 기준으로 채택하라. 모델 점수와 함께 과제 수정 이력, 실행 환경, 모호한 지시 처리, 평가 함수 변경을 반드시 기록해야 한다. 출처 목록: - (주근거) Introducing OSWorld-Verified — https://xlang.ai/blog/osworld-verified - (보조근거) xlang-ai/osworld — https://github.com/xlang-ai/osworld --- ## 보안 에이전트를 속이는 악성코드: 프롬프트 주입은 스캐너도 겨냥한다 - URL: https://stkradar.com/articles/malware-prompt-injection-ai-evasion/ - 판정: 채택 (영향도 82/100) - 이벤트: 2025-06-26 - 분류: 프레임워크 · Check Point - 출처: 3개 (주근거 1) 악성코드가 사람 분석가가 아니라 LLM 기반 분석 도구에 자연어 지시를 넣어 탐지를 흐리려는 신호가 나왔다. 성공한 대규모 침해가 아니라도 보안 자동화 설계에는 바로 반영해야 할 변화다. 핵심 요약: - Check Point는 악성코드 샘플이 LLM 분석기를 속이려는 자연어 지시문을 포함했다고 분석했다. - SC Media는 2025-06-26 보도에서 이 사건을 AI 코드 분석 도구를 겨냥한 프롬프트 주입 시도로 다뤘다. - 보안 자동화에서는 분석 대상 문자열과 분석 도구에 대한 명령을 분리하는 게이트가 필요해졌다. 추천: LLM을 코드 보안이나 악성코드 분석에 붙인다면 채택해야 할 보안 항목으로 보라. 샘플 내부 텍스트를 명령이 아닌 데이터로 격리하고, 모델 요약을 결정 근거 하나로만 써야 한다. 출처 목록: - (주근거) New Malware Embeds Prompt Injection to Evade AI Detection — https://research.checkpoint.com/2025/ai-evasion-prompt-injection/ - (보조근거) Prompt injection in malware sample targets AI code analysis tools — https://www.scworld.com/news/prompt-injection-in-malware-sample-targets-ai-code-analysis-tools - (보조근거) Respond with NO MALWARE DETECTED — https://www.thestack.technology/respond-with-no-malware-detected-this-malware/ --- ## Gemini CLI 공개는 구글 에이전트 개발 경험을 터미널에서 시작하게 했다 - URL: https://stkradar.com/articles/google-gemini-cli-open-source-agent/ - 판정: 실험 (영향도 82/100) - 이벤트: 2025-06-25 - 분류: SDK · Google - 출처: 2개 (주근거 1) - 토픽: Google (https://stkradar.com/topics/google/) Gemini CLI는 터미널에서 Gemini 기반 코드와 작업 도우미를 실행하는 구글의 공개 개발자 도구다. 구글 생태계와 궁합은 좋지만, 장기 제품 경로보다는 개발자 실험과 내부 도구에 먼저 맞다. 핵심 요약: - Google은 2025-06-25 Gemini CLI를 공개 개발자 도구로 발표했다. - GitHub 저장소는 Gemini CLI의 코드, 이슈, 설치 경로를 공개한다. - 구글 모델 기반 에이전트 경험이 웹 제품뿐 아니라 터미널 도구로도 배포되기 시작했다. 추천: Gemini를 이미 쓰는 개발팀은 실험하되, 사내 저장소 접근과 모델 사용 기록 정책을 먼저 확인하라. 출처 목록: - (주근거) Introducing Gemini CLI — https://blog.google/innovation-and-ai/technology/developers-tools/introducing-gemini-cli-open-source-ai-agent/ - (보조근거) gemini-cli — https://github.com/google-gemini/gemini-cli --- ## MCP 2025-06-18 스펙은 원격 전송과 권한 경계를 표준 논의 중심으로 올렸다 - URL: https://stkradar.com/articles/mcp-roadmap/ - 판정: 채택 (영향도 92/100) - 이벤트: 2025-06-18 - 분류: 프로토콜 · MCP 스펙 - 출처: 2개 (주근거 1) - 토픽: MCP (https://stkradar.com/topics/mcp/) MCP 2025-06-18 개정판은 원격 전송, 인증/리소스 서버 분리, 구조화된 도구 출력, 보안 경계와 프로토콜 버전 협상을 명확히 했다. MCP 서버를 만드는 사람에게는 즉시 영향이 크다. 핵심 요약: - 2025-06-18 스펙 개정판은 원격 전송과 인증/리소스 서버 변경을 공식 변경 기록에 올렸다. - 공식 문서는 호스트/클라이언트/서버 경계와 도구/리소스/프롬프트 기본 단위를 더 명확히 분리하고 프로토콜 버전 협상을 다룬다. - MCP 서버 작성자는 기능 추가보다 노출 도구 범위와 권한 경계를 먼저 설계해야 한다. 추천: 도구/리소스 경계는 MCP로 잡되, 작업 흐름 조율까지 MCP에 밀어 넣지는 않는 편이 좋다. 출처 목록: - (주근거) Changelog - Model Context Protocol Specification 2025-06-18 — https://modelcontextprotocol.io/specification/2025-06-18/changelog - (보조근거) Architecture - Model Context Protocol Specification 2025-06-18 — https://modelcontextprotocol.io/specification/2025-06-18/architecture --- ## promptfoo 에이전트 레드팀 기능은 도구 사용 실패를 보안 검사 대상으로 올렸다 - URL: https://stkradar.com/articles/promptfoo-agent-redteam-2025/ - 판정: 채택 (영향도 88/100) - 이벤트: 2025-06-15 - 분류: 평가 · promptfoo - 출처: 2개 (주근거 1) promptfoo의 2025년 에이전트 레드팀 기능은 도구 사용, 권한 우회, 목표 탈선 같은 실패를 자동 점검 대상으로 만든다. 외부 도구를 쓰는 에이전트 제품은 채택 우선순위가 높다. 핵심 요약: - promptfoo는 2025-06-15 에이전트 레드팀 기능을 소개했다. - 문서는 에이전트 대상 레드팀 설정과 공격 목표 정의 방식을 제공한다. - 보안 검사는 단일 응답 필터링에서 도구 사용 에이전트의 행동 경로 검사로 넓어졌다. 추천: 외부 도구를 쓰는 에이전트라면 채택하라. 제품별 권한 모델과 금지 행동 목록을 별도로 추가해야 효과가 난다. 출처 목록: - (주근거) New redteam agent — https://www.promptfoo.dev/blog/2025-summer-new-redteam-agent/ - (보조근거) Agents — https://www.promptfoo.dev/docs/red-team/agents/ --- ## Dagger Container Use는 에이전트 작업을 컨테이너 단위로 격리하는 실험을 제시했다 - URL: https://stkradar.com/articles/dagger-container-use-agents/ - 판정: 실험 (영향도 79/100) - 이벤트: 2025-06-14 - 분류: 프레임워크 · Dagger - 출처: 2개 (주근거 1) Dagger Container Use는 에이전트가 코드 작업을 컨테이너 안에서 수행하고 결과를 검토하게 하는 도구다. 위험한 파일 변경과 의존성 설치를 분리하려는 팀에는 실험 가치가 있다. 핵심 요약: - Dagger는 2025-06-14 에이전트용 Container Use 글을 공개했다. - GitHub 저장소는 에이전트 작업을 컨테이너 안에서 실행하고 결과를 관리하는 도구를 제공한다. - 코드 에이전트의 작업 공간을 운영체제 직접 변경보다 컨테이너 경계로 제한하는 흐름이 강화됐다. 추천: 코드 에이전트가 의존성을 자주 설치하거나 테스트를 많이 실행한다면 실험하라. 비밀값과 호스트 파일 접근은 기본 차단으로 두는 편이 좋다. 출처 목록: - (주근거) Agent Container Use — https://dagger.io/blog/agent-container-use/ - (보조근거) container-use — https://github.com/dagger/container-use --- ## MLflow 3는 에이전트 평가와 관측성을 실험 관리 안으로 합쳤다 - URL: https://stkradar.com/articles/mlflow-3-agent-eval-observability/ - 판정: 채택 (영향도 90/100) - 이벤트: 2025-06-09 - 분류: 평가 · MLflow - 출처: 2개 (주근거 1) MLflow 3는 모델 실험 관리에 생성형 AI 평가, 관측성, 거버넌스 축을 더했다. 이미 MLflow나 Databricks를 쓰는 팀은 에이전트 품질 관리를 한곳에 모을 후보로 채택할 만하다. 핵심 요약: - MLflow는 2025-06-09 MLflow 3 출시를 발표했다. - 출시 글은 실험, 관측성, 거버넌스가 하나의 AI 시스템 관리 흐름으로 합쳐졌다고 설명한다. - 에이전트 품질 관리는 단순 로그 저장보다 평가, 추적, 승인 기록을 함께 묶는 방향으로 이동했다. 추천: MLflow나 Databricks를 이미 운영 중이면 채택하라. 별도 체계를 쓰는 팀은 데이터 반출과 저장소 비용을 먼저 비교해야 한다. 출처 목록: - (주근거) MLflow 3 Launch — https://mlflow.org/blog/mlflow-3-launch/ - (보조근거) MLflow 3.0: Unified AI Experimentation, Observability, and Governance — https://www.databricks.com/blog/mlflow-30-unified-ai-experimentation-observability-and-governance --- ## RedTeamCUA는 컴퓨터 사용 에이전트의 위험 행동을 직접 겨냥했다 - URL: https://stkradar.com/articles/redteamcua-computer-use-security/ - 판정: 채택 (영향도 84/100) - 이벤트: 2025-05-28 - 분류: 평가 · arXiv - 출처: 2개 (주근거 1) - 토픽: arXiv (https://stkradar.com/topics/arxiv/) RedTeamCUA는 컴퓨터 사용 에이전트가 화면과 도구를 다루는 과정에서 위험한 지시를 어떻게 처리하는지 평가한다. 화면 조작형 에이전트에는 보안 점검 기준으로 채택할 만하다. 핵심 요약: - RedTeamCUA 논문은 2025-05-28 arXiv에 공개됐다. - GitHub 저장소는 컴퓨터 사용 에이전트 보안 평가 자원을 제공한다. - 화면 조작형 에이전트 평가는 작업 완료율뿐 아니라 위험 지시 거부와 피해 방지로 넓어졌다. 추천: 화면 조작형 에이전트를 만들거나 구매한다면 채택하라. 권한 상승, 민감 정보 입력, 위험 클릭을 별도 시험 항목으로 둬야 한다. 출처 목록: - (주근거) RedTeamCUA — https://arxiv.org/abs/2505.21936 - (보조근거) RedTeamCUA — https://github.com/OSU-NLP-Group/RedTeamCUA --- ## Claude Code Agent SDK는 터미널형 코딩 에이전트를 외부 앱에 붙이는 통로가 됐다 - URL: https://stkradar.com/articles/anthropic-claude-code-agent-sdk/ - 판정: 실험 (영향도 86/100) - 이벤트: 2025-05-22 - 분류: SDK · Anthropic - 출처: 2개 (주근거 1) - 토픽: Anthropic (https://stkradar.com/topics/anthropic/) Claude Code Agent SDK는 Claude Code의 작업 수행 능력을 명령줄 밖 제품과 자동화에 연결하는 선택지다. Claude Code를 이미 쓰는 팀에는 매력적이지만, 제공자 의존과 권한 경계를 먼저 검증해야 한다. 핵심 요약: - Anthropic은 2025-05-22 Claude 4 발표에서 Claude Code 일반 제공과 SDK 흐름을 함께 다뤘다. - Agent SDK 문서는 Claude Code를 앱과 자동화 안에서 호출하는 개발자 표면을 설명한다. - 터미널 중심 코딩 에이전트가 별도 제품 기능으로 내장될 수 있는 길이 넓어졌다. 추천: Claude Code가 팀 표준이면 실험하되, 저장소 권한과 작업 로그 보존 방식을 먼저 작게 검증하라. 출처 목록: - (주근거) Introducing Claude 4 — https://www.anthropic.com/news/claude-4 - (보조근거) Claude Code Agent SDK overview — https://code.claude.com/docs/en/agent-sdk/overview --- ## Azure AI Foundry Agent Service GA는 기업형 에이전트 서비스를 Azure 표준 후보로 올렸다 - URL: https://stkradar.com/articles/azure-ai-foundry-agent-service-ga/ - 판정: 주시 (영향도 83/100) - 이벤트: 2025-05-19 - 분류: 프레임워크 · Microsoft - 출처: 2개 (주근거 1) - 토픽: Microsoft (https://stkradar.com/topics/microsoft/) Azure AI Foundry Agent Service 일반 제공은 Azure 안에서 에이전트 생성, 도구 연결, 기업 관리 기능을 묶는 기준점이다. Microsoft 생태계 팀은 빠르게 주시해야 한다. 핵심 요약: - Microsoft는 2025-05-19 Azure AI Foundry Agent Service 일반 제공을 발표했다. - Agent Service는 Azure AI Foundry 안에서 에이전트 작성, 도구 연결, 기업 관리 기능을 묶는다. - Azure 중심 조직의 에이전트 스택 평가는 독립 프레임워크만이 아니라 Foundry 관리형 서비스까지 포함해야 한다. 추천: Azure 중심 팀은 주시하며 내부 파일럿을 잡아라. 독립 제품 팀은 에이전트 정의와 상태 저장을 Azure 밖에서도 설명 가능하게 유지해야 한다. 출처 목록: - (주근거) Announcing General Availability of Azure AI Foundry Agent Service — https://techcommunity.microsoft.com/blog/azure-ai-foundry-blog/announcing-general-availability-of-azure-ai-foundry-agent-service/4414352 - (보조근거) What is Azure AI Foundry Agent Service? — https://learn.microsoft.com/en-us/azure/ai-foundry/agents/overview --- ## NLWeb은 웹사이트가 대화형 질의 경계를 직접 제공하는 방향을 제시했다 - URL: https://stkradar.com/articles/nlweb-agentic-web/ - 판정: 실험 (영향도 80/100) - 이벤트: 2025-05-19 - 분류: 프로토콜 · Microsoft - 출처: 2개 (주근거 1) - 토픽: Microsoft (https://stkradar.com/topics/microsoft/) NLWeb은 웹사이트가 자연어 질의 인터페이스를 직접 제공하도록 돕는 Microsoft의 시도다. 웹 안에서 에이전트가 사이트 지식과 상호작용하는 방식을 바꿀 수 있지만, 아직은 실험 단계로 보는 편이 맞다. 핵심 요약: - Microsoft는 2025-05-19 NLWeb 소개 글을 공개했다. - NLWeb 저장소는 웹사이트가 대화형 질의 인터페이스를 제공하는 구현 자료를 제공한다. - 웹 콘텐츠 접근이 검색 페이지와 API 문서에서 사이트가 직접 제공하는 대화형 경계로 확장될 수 있다. 추천: 콘텐츠가 많은 웹사이트라면 실험하라. 공개 채택과 클라이언트 지원이 확인되기 전에는 핵심 접근 경로로 의존하지 않는 편이 좋다. 출처 목록: - (주근거) Introducing NLWeb — https://news.microsoft.com/source/features/company-news/introducing-nlweb-bringing-conversational-interfaces-directly-to-the-web/ - (보조근거) NLWeb — https://github.com/nlweb-ai/NLWeb --- ## AWS Strands Agents는 모델 주도 도구 호출을 AWS식 운영 선택과 함께 가져온다 - URL: https://stkradar.com/articles/aws-strands-agents/ - 판정: 실험 (영향도 79/100) - 이벤트: 2025-05-16 - 분류: SDK · AWS Strands - 출처: 2개 (주근거 1) AWS Strands Agents는 모델이 계획과 도구 호출 순서를 주도하는 에이전트 SDK다. 진입 장벽은 낮지만 배포와 관측 선택이 AWS 쪽으로 기울 수 있어 실험 판정이 맞다. 핵심 요약: - AWS는 2025-05-16 Strands Agents를 오픈소스 AI Agents SDK로 소개했다. - Strands는 모델 주도 방식으로 도구, 모델, 프롬프트를 연결해 에이전트 구성을 단순화한다. - AWS 배포와 관측성 선택을 이미 받아들이는 팀에는 시작 비용이 낮지만, 스택 중립성을 원하는 팀에는 경계가 필요하다. 추천: 이미 AWS 배포와 관측성 선택을 받아들이는 팀은 작은 도구 에이전트로 실험하라. 제공자 종속을 피해야 하는 제품은 추상 경계를 먼저 둬야 한다. 출처 목록: - (주근거) Introducing Strands Agents, an open source AI agents SDK — https://aws.amazon.com/blogs/opensource/introducing-strands-agents-an-open-source-ai-agents-sdk/ - (보조근거) Strands Agents Blog — https://strandsagents.com/blog/ --- ## OpenAI Codex는 클라우드 코딩 에이전트를 제품 표면으로 만들었다 - URL: https://stkradar.com/articles/openai-codex-cloud-agent/ - 판정: 채택 (영향도 87/100) - 이벤트: 2025-05-16 - 분류: SDK · OpenAI - 출처: 2개 (주근거 1) - 토픽: OpenAI (https://stkradar.com/topics/openai/) OpenAI의 Codex 공개는 범용 에이전트 SDK가 아니라 코드베이스 작업을 클라우드 실행 환경에 위임하는 제품화된 코딩 에이전트 신호다. 여러 작업을 병렬로 맡기고 결과를 검토하는 흐름이 개인 개발자와 작은 팀의 작업 방식에 직접 영향을 준다. 핵심 요약: - OpenAI는 2025-05-16 Codex를 클라우드 기반 소프트웨어 엔지니어링 에이전트로 공개했다. - 코드 작성, 버그 수정, 테스트 실행, 코드베이스 질문을 별도 작업으로 맡기는 제품 경험이 전면에 나왔다. - 기존 OpenAI Agents SDK처럼 앱 안의 범용 에이전트 조율을 제공하는 것이 아니라, 코딩 작업 실행 환경을 제공한다. 추천: 반복 코딩 작업, 테스트 보강, 작은 버그 수정을 병렬로 맡기는 용도는 채택하라. 권한 있는 저장소에서는 계획, diff, 테스트 출력 확인을 필수로 둬야 한다. 출처 목록: - (주근거) Introducing Codex — https://openai.com/index/introducing-codex/ - (보조근거) Codex changelog — https://developers.openai.com/codex/changelog --- ## AG-UI는 MCP/A2A 옆의 에이전트-프론트엔드 상호작용 계층으로 봐야 한다 - URL: https://stkradar.com/articles/ag-ui-protocol/ - 판정: 실험 (영향도 78/100) - 이벤트: 2025-05-12 - 분류: 프로토콜 · AG-UI - 출처: 3개 (주근거 2) AG-UI는 에이전트 실행 환경과 사용자 대상 앱 사이의 이벤트 기반 연결을 표준화하려는 프로토콜이다. UI가 제품 가치인 빌더에게는 실험 가치가 크지만, 모든 에이전트에 기본 채택할 단계는 아니다. 핵심 요약: - 에이전트 프로토콜 논의가 도구(MCP), 에이전트 간 협업(A2A)에서 사용자 대상 UI 상호작용까지 확장된다. - AG-UI는 에이전트 상태, UI 의도, 사용자 입력을 이벤트 스트림으로 다루며 프론트엔드 연결 작업 비용을 줄이려 한다. - LangGraph, CrewAI, Microsoft Agent Framework, Pydantic AI 같은 프레임워크 연동 신호가 이미 문서에 잡혀 있다. 추천: 채팅을 넘어 실시간 상태, 승인, 중단, 프론트엔드 도구 호출이 중요한 제품이면 실험하라. 백엔드 도구 호출만 필요한 에이전트에는 MCP 경계부터 정리하는 것이 먼저다. 출처 목록: - (주근거) Introducing AG-UI: The Protocol Where Agents Meet Users — https://www.copilotkit.ai/blog/introducing-ag-ui-the-protocol-where-agents-meet-users - (주근거) AG-UI Overview — https://docs.ag-ui.com/introduction - (보조근거) ag-ui-protocol/ag-ui — https://github.com/ag-ui-protocol/ag-ui --- ## WASP는 웹 에이전트 보안을 평가할 수 있는 공격 과제를 공개했다 - URL: https://stkradar.com/articles/wasp-web-agent-security-benchmark/ - 판정: 채택 (영향도 85/100) - 이벤트: 2025-04-22 - 분류: 평가 · arXiv - 출처: 2개 (주근거 1) - 토픽: arXiv (https://stkradar.com/topics/arxiv/) WASP는 웹 에이전트가 악성 지시, 민감 정보 노출, 권한 오용에 얼마나 취약한지 확인하는 평가 과제다. 브라우저 에이전트 제품을 만드는 팀에는 기본 보안 시험 후보가 됐다. 핵심 요약: - WASP 논문은 2025-04-22 arXiv에 공개됐다. - GitHub 저장소는 웹 에이전트 보안 평가 자원과 실행 맥락을 제공한다. - 웹 에이전트 품질 평가가 단순 작업 성공률에서 보안 실패 검출로 확장됐다. 추천: 브라우저 에이전트를 배포하거나 조달한다면 채택하라. 기능 성공률과 별도로 민감 정보, 권한, 악성 지시 대응을 시험해야 한다. 출처 목록: - (주근거) WASP: Benchmarking Web Agent Security Against Prompt Injection Attacks — https://arxiv.org/abs/2504.18575 - (보조근거) wasp — https://github.com/facebookresearch/wasp --- ## BrowseComp는 웹 탐색 능력을 긴 검색 과제로 재측정했다 - URL: https://stkradar.com/articles/browsecomp-web-browsing-eval/ - 판정: 채택 (영향도 85/100) - 이벤트: 2025-04-10 - 분류: 평가 · OpenAI - 출처: 2개 (주근거 1) - 토픽: OpenAI (https://stkradar.com/topics/openai/) BrowseComp는 웹에서 숨은 정보를 찾아 답해야 하는 어려운 탐색 평가다. 브라우징 에이전트의 실제 조사 능력을 보려는 팀에는 단순 질의응답보다 나은 기준이 된다. 핵심 요약: - OpenAI는 2025-04-10 BrowseComp를 공개했다. - simple-evals 저장소는 공개 평가 구현과 관련 자료를 제공한다. - 웹 탐색 평가는 한 번의 검색 결과 요약보다 여러 단서를 찾아 합치는 어려운 과제로 옮겨갔다. 추천: 웹 탐색 에이전트를 비교한다면 채택하라. 답의 정확도뿐 아니라 출처 회수, 중간 근거, 실패 유형을 함께 기록해야 한다. 출처 목록: - (주근거) BrowseComp — https://openai.com/index/browsecomp/ - (보조근거) simple-evals — https://github.com/openai/simple-evals --- ## IBM BeeAI는 다중 에이전트 상호운용을 거버넌스 문제로 끌어올린다 - URL: https://stkradar.com/articles/ibm-beeai-multiagent/ - 판정: 주시 (영향도 73/100) - 이벤트: 2025-03-17 - 분류: 프레임워크 · IBM BeeAI - 출처: 2개 (주근거 1) IBM BeeAI는 단일 프레임워크 경쟁보다 다중 에이전트 상호운용과 거버넌스 방향을 강조한다. 개인 개발자에게는 아직 주시 단계지만, ACP/A2A류 연동이 실제 통합 경로가 되는지 볼 가치가 있다. 핵심 요약: - IBM Research는 2025-03-17 BeeAI를 다중 에이전트 플랫폼 방향으로 설명했다. - BeeAI는 개별 에이전트 기능보다 여러 에이전트의 발견, 연결, 협업, 거버넌스 문제를 전면에 둔다. - ACP와 A2A 같은 상호운용 표준 신호가 실제 통합 비용을 낮출지 지켜봐야 한다. 추천: 기업 연동과 에이전트 상호운용이 핵심이면 주시 목록에 두라. 개인 개발자는 내부 상태 관리와 도구 경계를 먼저 정리하는 편이 낫다. 출처 목록: - (주근거) BeeAI: an open-source multi-agent platform — https://research.ibm.com/blog/multiagent-bee-ai - (보조근거) BeeAI Framework — https://research.ibm.com/projects/bee-ai-framework --- ## OpenAI의 2025-03-11 Agents SDK 공개는 코드 중심 작업 조율과 실행 추적을 묶었다 - URL: https://stkradar.com/articles/openai-agents-sdk/ - 판정: 실험 (영향도 81/100) - 이벤트: 2025-03-11 - 분류: SDK · OpenAI - 출처: 3개 (주근거 2) - 토픽: OpenAI (https://stkradar.com/topics/openai/) OpenAI의 2025-03-11 에이전트 제작 도구 발표는 도구, 인계, 실행 추적을 코드 우선 작업 조율 패키지로 묶었다. 빠른 시제품에 유리하지만 특정 제공자 중심 종속성 평가는 별도로 해야 한다. 핵심 요약: - 2025-03-11 발표에서 에이전트 앱의 기본 구성 요소가 도구, 인계, 스트리밍, 추적으로 묶여 제공됐다. - 복잡한 그래프를 직접 설계하지 않고도 전문 에이전트 인계를 빠르게 붙일 수 있다. - 추적 우선 개발 흐름이 에이전트 품질 관리의 기본 기대치가 되고 있다. 추천: OpenAI 중심 제품이면 실험에서 시작할 만하다. 멀티모델/멀티벤더 장기 전략이면 경계를 분리해 둬야 한다. 출처 목록: - (주근거) New tools for building agents — https://openai.com/index/new-tools-for-building-agents/ - (주근거) Agents - OpenAI API — https://developers.openai.com/api/docs/guides/agents - (보조근거) Tracing - OpenAI Agents SDK — https://openai.github.io/openai-agents-python/tracing/ --- ## OpenTelemetry GenAI 규약은 에이전트 관측성을 벤더 밖으로 꺼낸다 - URL: https://stkradar.com/articles/opentelemetry-genai-agent-semconv/ - 판정: 주시 (영향도 84/100) - 이벤트: 2025-03-06 - 분류: 프로토콜 · OpenTelemetry - 출처: 2개 (주근거 1) OpenTelemetry의 GenAI 에이전트 의미 규약은 에이전트 관측성을 특정 대시보드가 아니라 공통 스팬과 속성 문제로 다룬다. 장기 운영을 생각하는 팀에는 표준 신호로 중요하다. 핵심 요약: - OpenTelemetry는 2025-03-06 AI 에이전트 관측성 글을 통해 GenAI 의미 규약 방향을 설명했다. - 에이전트 호출, 도구 호출, 대화 단계가 공통 스팬과 속성으로 표현되면 벤더별 대시보드 의존이 줄어든다. - 운영 팀은 Langfuse나 Phoenix 같은 도구를 쓰더라도 하위 데이터 모델을 표준과 맞출 수 있다. 추천: 운영 로그와 실행 추적을 이미 설계 중이면 주시하면서 OpenTelemetry 속성 이름을 맞춰라. 작은 실험 단계에서는 도구별 기본 관측성으로 시작해도 된다. 출처 목록: - (주근거) AI Agent Observability with OpenTelemetry — https://opentelemetry.io/blog/2025/ai-agent-observability/ - (보조근거) GenAI agent spans — https://opentelemetry.io/docs/specs/semconv/gen-ai/gen-ai-agent-spans/ --- ## Vertex AI Agent Engine GA는 관리형 에이전트 배포를 구글 클라우드 기준으로 만들었다 - URL: https://stkradar.com/articles/vertex-ai-agent-engine-ga/ - 판정: 주시 (영향도 84/100) - 이벤트: 2025-03-04 - 분류: 프레임워크 · Google Cloud - 출처: 2개 (주근거 1) Vertex AI Agent Engine 일반 제공은 에이전트 배포, 과금, 관리 기능을 Google Cloud 안에서 공식 제품 기준으로 묶었다. Google Cloud 중심 팀에는 주시 우선 후보가 됐다. 핵심 요약: - Google Cloud 릴리스 노트는 2025-03-04 Vertex AI Agent Engine 일반 제공을 기록했다. - 같은 항목은 LangChain on Vertex AI가 Vertex AI Agent Engine으로 이름이 바뀌었다고 설명한다. - 클라우드 관리형 에이전트 배포가 실험 기능이 아니라 과금 대상 공식 제품으로 이동했다. 추천: Google Cloud 중심 조직은 주시하며 파일럿을 진행하라. 멀티클라우드 요구가 있으면 에이전트 로직과 배포 계층을 분리해 두는 편이 좋다. 출처 목록: - (주근거) Vertex AI release notes — https://docs.cloud.google.com/vertex-ai/generative-ai/docs/release-notes - (보조근거) Vertex AI Agent Engine overview — https://cloud.google.com/vertex-ai/generative-ai/docs/agent-engine/overview --- ## AgentHarm은 에이전트 안전성 평가를 악성 작업 수행 여부까지 확장했다 - URL: https://stkradar.com/articles/agentharm-agent-safety-benchmark/ - 판정: 채택 (영향도 88/100) - 이벤트: 2025-01-22 - 분류: 평가 · AgentHarm - 출처: 2개 (주근거 1) AgentHarm은 에이전트가 악성 요청을 거부하는지와 탈옥 뒤 여러 단계 작업을 수행하는지를 함께 보는 안전성 벤치마크다. 도구 사용 에이전트 제품에는 채택 우선순위가 높다. 핵심 요약: - OpenReview 기록은 AgentHarm 논문을 2025-01-22 공개 논문으로 제시한다. - AgentHarm은 110개 악성 에이전트 작업과 증강 작업을 통해 거부와 수행 능력을 함께 평가한다. - 도구를 쓰는 에이전트 안전성은 단순 대화 거부율만으로 판단하기 어렵다는 기준을 만들었다. 추천: 도구 사용 에이전트를 배포한다면 채택하라. 다만 내부 도구 권한과 산업별 위험 작업을 추가해 보완해야 한다. 출처 목록: - (주근거) AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents — https://openreview.net/forum?id=AC5n7xHuR1 - (보조근거) AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents — https://arxiv.org/abs/2410.09024 --- ## LlamaIndex AgentWorkflow는 데이터 중심 앱에 더 선명한 에이전트 작업 흐름을 준다 - URL: https://stkradar.com/articles/llamaindex-agentworkflow/ - 판정: 실험 (영향도 74/100) - 이벤트: 2025-01-22 - 분류: 프레임워크 · LlamaIndex - 출처: 2개 (주근거 1) LlamaIndex AgentWorkflow는 LlamaIndex 안에서 에이전트 작업 흐름을 구성하는 공식 경로를 제공한다. 이미 LlamaIndex 데이터와 도구 생태계에 있는 앱에는 좋지만, 범용 조율 계층으로 보기에는 실험이 맞다. 핵심 요약: - LlamaIndex는 2025-01-22 AgentWorkflow를 에이전트 시스템 구축 경로로 발표했다. - AgentWorkflow는 여러 에이전트와 도구를 이벤트 기반 단계로 연결해 상태 관리와 인계를 다룬다. - LlamaIndex 데이터 연결을 이미 쓰는 팀에는 새 프레임워크를 추가하지 않고 조율 기능을 확장하는 선택지가 된다. 추천: LlamaIndex 검색/도구 기반 제품이면 작은 다단계 작업으로 실험하라. 데이터 계층이 다르면 직접 작성이나 LangGraph와 비용을 비교해야 한다. 출처 목록: - (주근거) Introducing AgentWorkflow: A Powerful System for Building AI Agent Systems — https://www.llamaindex.ai/blog/introducing-agentworkflow-a-powerful-system-for-building-ai-agent-systems - (보조근거) Basic AgentWorkflow — https://developers.llamaindex.ai/python/examples/agent/agent_workflow_basic/ --- ## Modal Sandboxes GA는 코드 에이전트의 격리 실행을 제품 기능으로 만든다 - URL: https://stkradar.com/articles/modal-sandboxes-ga/ - 판정: 실험 (영향도 76/100) - 이벤트: 2025-01-21 - 분류: SDK · Modal - 출처: 2개 (주근거 1) Modal Sandboxes 일반 제공은 비신뢰 코드 실행이 코드 에이전트의 주변 기능이 아니라 핵심 인프라가 되고 있음을 보여준다. Python 기반 자동화 팀은 E2B와 함께 비교할 만하다. 핵심 요약: - Modal은 2025-01-21 Sandboxes 일반 제공을 발표했다. - Sandboxes는 에이전트가 생성하거나 받은 코드를 격리된 실행 환경에서 돌리는 제품화된 기반을 제공한다. - 코드 에이전트 채택 기준은 모델 품질만이 아니라 격리, 파일 수명, 네트워크 제어, 비용으로 이동한다. 추천: Python 기반 코드 에이전트를 만들면 실험하라. 사용자 입력 코드를 실행하기 전에는 자원 제한, 네트워크 정책, 로그 보존을 반드시 검증해야 한다. 출처 목록: - (주근거) Modal Sandboxes are generally available — https://modal.com/blog/sandbox-launch - (보조근거) Sandboxes — https://modal.com/products/sandboxes --- ## AutoGen v0.4는 Microsoft 에이전트 경로의 전환점을 남겼다 - URL: https://stkradar.com/articles/autogen-v04-maintenance/ - 판정: 주시 (영향도 72/100) - 이벤트: 2025-01-14 - 분류: 프레임워크 · AutoGen - 출처: 2개 (주근거 1) AutoGen v0.4는 확장성과 견고성을 위해 기반을 다시 설계한 중요한 전환점이다. 다만 새 프로젝트는 Microsoft Agent Framework가 더 앞선 기본 경로가 되는지 함께 확인해야 한다. 핵심 요약: - Microsoft Research는 2025-01-14 AutoGen v0.4를 확장성, 견고성, 비동기 이벤트 기반 구조를 위한 재설계로 발표했다. - v0.4는 이전 AutoGen 사용자가 새 AgentChat 구조로 옮겨야 하는 마이그레이션 지점이 되었다. - Microsoft Agent Framework가 별도 기본 경로로 커지면서 AutoGen 평가는 유지보수 신호와 이전 비용을 함께 봐야 한다. 추천: 기존 AutoGen 코드가 있으면 v0.4 마이그레이션 비용을 먼저 산정하라. 새 Microsoft 기반 에이전트라면 Microsoft Agent Framework와 나란히 검토해야 한다. 출처 목록: - (주근거) AutoGen v0.4: Reimagining the foundation of agentic AI for scale, extensibility, and robustness — https://www.microsoft.com/en-us/research/blog/autogen-v0-4-reimagining-the-foundation-of-agentic-ai-for-scale-extensibility-and-robustness/ - (보조근거) Migration Guide — https://microsoft.github.io/autogen/stable/user-guide/agentchat-user-guide/migration-guide.html --- ## smolagents는 작은 Python 코드 에이전트를 빠르게 실험하게 한다 - URL: https://stkradar.com/articles/huggingface-smolagents-code-agents/ - 판정: 실험 (영향도 76/100) - 이벤트: 2024-12-31 - 분류: SDK · smolagents - 출처: 2개 (주근거 1) Hugging Face smolagents는 코드로 행동하는 작은 에이전트를 단순한 Python 표면으로 제공한다. 채택 경계는 코드 실행 안전성, 격리 방식, 로컬 모델 실험의 통제 가능성이다. 핵심 요약: - Hugging Face는 2024-12-31 smolagents를 간단한 코드 에이전트 라이브러리로 공개했다. - smolagents는 JSON 도구 호출보다 Python 코드 실행을 중심에 두어 짧은 자동화와 모델 실험에 맞다. - 비신뢰 코드나 외부 입력을 다룰 때는 격리 실행 환경 선택이 제품 채택의 핵심 조건이 된다. 추천: 개인 실험이나 로컬 모델 도구 자동화에는 작게 실험하라. 사용자 입력을 실행하는 제품에서는 격리 실행 환경과 권한 제한을 먼저 정해야 한다. 출처 목록: - (주근거) Introducing smolagents — https://huggingface.co/blog/smolagents - (보조근거) smolagents — https://huggingface.co/docs/smolagents/en/index --- ## Inngest AgentKit과 step.ai는 에이전트를 내구 백엔드 단계로 본다 - URL: https://stkradar.com/articles/inngest-agentkit-step-ai/ - 판정: 실험 (영향도 75/100) - 이벤트: 2024-11-22 - 분류: SDK · Inngest - 출처: 2개 (주근거 1) Inngest AgentKit과 step.ai는 TypeScript 팀이 에이전트 호출을 내구 단계, 재시도, 실행 추적 안에서 다루게 한다. 프론트엔드 중심 도구보다 백엔드 조율 관점이 강한 선택지다. 핵심 요약: - Inngest는 2024-11-22 AgentKit과 step.ai를 에이전트 조율 경로로 소개했다. - 접근은 모델 호출을 백엔드 단계로 분해하고 재시도와 관측성을 붙이는 쪽에 가깝다. - TypeScript 팀은 기존 Inngest 함수와 함께 에이전트 단계를 운영 단위로 추적할 수 있다. 추천: Inngest를 이미 쓰는 TypeScript 팀은 실험하라. 단순 프론트엔드 대화형 기능이면 Vercel AI SDK류와 먼저 비교하는 편이 낫다. 출처 목록: - (주근거) AI orchestration with AgentKit and step.ai — https://www.inngest.com/blog/ai-orchestration-with-agentkit-step-ai - (보조근거) AgentKit — https://agentkit.inngest.com/ --- ## AISI 평가 저장소 공개는 에이전트 벤치마크를 재사용 가능한 체계로 묶었다 - URL: https://stkradar.com/articles/inspect-evals-agent-benchmarks/ - 판정: 채택 (영향도 84/100) - 이벤트: 2024-11-13 - 분류: 평가 · AI Security Institute - 출처: 2개 (주근거 1) AI Security Institute의 공개 평가 저장소는 에이전트, 코딩, 사이버보안, 안전성 평가를 공개 저장소와 패키지 형태로 모으는 기준점이다. 평가 체계를 만드는 팀은 채택할 만하다. 핵심 요약: - AI Security Institute는 2024-11-13 공개 평가 저장소 발표를 냈다. - 이 저장소는 Inspect AI용 공개 평가 모음을 저장소와 문서 사이트로 제공한다. - 에이전트 성능과 안전성 평가는 자체 스프레드시트가 아니라 재사용 가능한 평가 코드와 데이터로 관리되는 방향이 강해졌다. 추천: 에이전트 품질 게이트를 만들면 채택하라. 공개 평가를 그대로 신뢰하기보다 내부 작업군과 함께 섞어 기준선을 만들어야 한다. 출처 목록: - (주근거) Announcing Inspect Evals — https://www.aisi.gov.uk/blog/inspect-evals - (보조근거) inspect_evals — https://github.com/UKGovernmentBEIS/inspect_evals --- ## Pydantic AI는 Python 빌더에게 타입과 평가를 먼저 잡는 에이전트 프레임워크다 - URL: https://stkradar.com/articles/pydantic-ai-typed-agents/ - 판정: 실험 (영향도 72/100) - 이벤트: 2024-10-29 - 분류: 프레임워크 · Pydantic AI - 출처: 3개 (주근거 2) Pydantic AI는 익숙한 Pydantic 타입/검증 감각으로 에이전트, 도구, 출력, 의존성을 묶는다. 모델 독립성과 Logfire/평가 흐름은 좋지만, 이미 다른 조율 스택이 있으면 중복 계층이 될 수 있다. 핵심 요약: - 2024년 최초 공개 이후 Python 에이전트 프레임워크 선택 기준이 간단한 에이전트 루프에서 타입 안정성, 관측성, 평가 연결까지 확장된다. - Agent를 LLM 상호작용의 기본 인터페이스로 두고 타입 지정 의존성, 도구, 출력을 함께 설계하게 한다. - Logfire와 평가를 전면에 두면서 에이전트 품질을 추적 가능한 개발 루프로 끌어올린다. 추천: Python 제품에서 구조화 출력, 타입 지정 의존성, 평가 추적이 중요하면 실험하라. 이미 LangGraph류 상태 그래프가 핵심이면 에이전트 단위 보조 계층으로 경계를 좁혀 보는 편이 낫다. 출처 목록: - (주근거) v0.0.1 2024-10-29 — https://github.com/pydantic/pydantic-ai/releases/tag/v0.0.1 - (주근거) Agents - Pydantic AI — https://pydantic.dev/docs/ai/core-concepts/agent/ - (보조근거) pydantic/pydantic-ai — https://github.com/pydantic/pydantic-ai --- ## CrewAI는 역할 기반 설명성이 있지만 로그/실행 추적 마찰 커뮤니티 신호가 있다 - URL: https://stkradar.com/articles/crewai-business/ - 판정: 주시 (영향도 63/100) - 이벤트: 2024-05-09 - 분류: 프레임워크 · Reddit - 출처: 3개 CrewAI의 역할 기반 다중 에이전트 모델은 설명하기 쉽다. 다만 2024-05-09 Reddit 스레드는 로그/실행 추적/문제 추적 마찰에 대한 일화성 커뮤니티 신호이며, 공식 문서는 모델과 아키텍처 맥락으로만 봐야 한다. 핵심 요약: - Crew/role/task 은유는 비개발자에게 에이전트 작업 흐름을 설명하기 쉽다. - 2024-05-09 Reddit 스레드는 로그/실행 추적/문제 추적 마찰을 묻는 날짜가 확인된 커뮤니티 신호다. - 이 신호는 광범위한 합의나 현재 출시 평가가 아니라 운영 점검 항목으로만 다뤄야 한다. 추천: 비개발자에게 에이전트 작업 흐름을 설명해야 하면 주시하되, 로그/실행 추적/문제 추적 요구는 현재 문서와 직접 시제품으로 따로 확인하라. 출처 목록: - (커뮤니티신호) Full Logging of Interactions with LLMs - r/crewai — https://www.reddit.com/r/crewai/comments/1co1of0/ - (보조근거) Crews - CrewAI — https://docs.crewai.com/en/concepts/crews - (보조근거) Production Architecture - CrewAI — https://docs.crewai.com/en/concepts/production-architecture