Kyurasi 큐라시

kyurasi.com/@kyurasi

클로드·딥시크·뮤즈, AI 경쟁은 ‘하네스 권한’으로 간다

Claude Code Mods, DeepSeek Harness, Muse Gadget SDK와 Apple의 macOS 권한 강화를 통해 AI 에이전트 경쟁이 모델에서 하네스·플러그인·운영체제 통제로 이동한 이유를 분석합니다.

클로드·딥시크·뮤즈, AI 경쟁은 ‘하네스 권한’으로 간다

클로드·딥시크·뮤즈, AI 경쟁은 ‘하네스 권한’으로 간다

📅
KyurasiKyurasi
1
#AI에이전트#에이전트하네스#ClaudeCode#DeepSeekHarness#MetaMuse#macOS보안#개발자도구#플러그인보안
💡이 글의 요약

확장 가능한 AI 하네스가 새 제품 전장이 됐다. Claude Mods와 DeepSeek·Muse의 개방성, Apple의 권한 강화를 함께 보면 경쟁력은 모델보다 실행 경계에서 갈린다.

요약

AI 에이전트 경쟁의 새 전장은 모델 자체가 아니라 모델이 실제 일을 하도록 감싸는 ‘하네스’다. Anthropic은 Claude Code의 프롬프트, 도구 호출, 승인 흐름, 화면까지 TypeScript로 바꾸는 Mods를 공개했고, DeepSeek는 모든 기능을 플러그인으로 조립하는 오픈소스 Harness를 데스크톱까지 확장했다. Meta는 Muse를 ESP32와 Raspberry Pi의 센서·액추에이터에 연결하는 Gadget SDK를 열었다.

세 발표의 공통점은 사용자가 에이전트의 동작 방식을 기다리지 않고 직접 고치고 배포하게 만든다는 데 있다. 모델이 같은 상태에서도 어떤 도구를 보여주고, 어떤 작업을 위임하며, 어떤 결과를 승인받는지에 따라 제품의 유용성이 달라진다. 에이전트의 ‘성격’은 프롬프트보다 실행 껍질에서 더 많이 결정되기 시작했다.

그러나 확장성은 곧 권한의 확대다. Apple은 AI 에이전트가 파일·메일·메시지·브라우징 기록에 닿는 위험을 이유로 macOS의 전체 디스크 접근에 더 명시적인 사용자 동작을 요구하겠다고 밝혔다. 이제 좋은 에이전트 제품은 기능을 많이 붙이는 제품이 아니라, 확장 기능이 어디까지 개입할 수 있는지 사용자가 이해하고 되돌릴 수 있게 만드는 제품이다.

모델 밖에서 성능이 만들어진다

하네스는 모델과 도구 사이의 배선 정도가 아니다. 최근 공개된 소프트웨어 엔지니어링 에이전트 연구는 같은 계열 모델도 도구 레지스트리, 작업별 하위 에이전트, 계획, 스킬, 컨텍스트 관리 방식에 따라 결과가 달라진다는 점을 실험으로 분리했다. 연구진의 NanoHarness는 단순한 mini-SWE-agent보다 Qwen3.7-Max에서 7.37%포인트, DeepSeek-V4-Pro에서 6.21%포인트 높은 ProgramBench 점수를 기록했다.

더 중요한 결과는 모든 기능이 도움이 되지는 않았다는 사실이다. 작업에 맞춘 하위 에이전트와 구조화된 도구는 안정적으로 성능을 높였지만, 일반 목적 하위 에이전트와 공격적인 컨텍스트 압축은 오히려 성능을 떨어뜨렸다. 하네스 경쟁은 버튼을 더 붙이는 경쟁이 아니라, 모델의 탐색을 어떤 구조로 제한하고 어떤 증거를 끝까지 보존할지의 경쟁이다.

이 관점에서 최근 발표들은 하나의 흐름으로 읽힌다. 모델 회사는 더 이상 가중치와 API만 공급하지 않는다. 사용자가 에이전트의 사건 흐름, 화면, 플러그인, 기억, 장치 연결을 조립하는 운영 환경을 차지하려 한다. 모델 선택은 그 환경 안의 한 설정이 되고, 제품 충성도는 플러그인과 작업 기록, 승인 규칙에 더 강하게 묶일 수 있다.

Claude Mods는 인터페이스를 실행 코드로 바꿨다

Claude Code Mods는 작은 TypeScript 함수가 에이전트의 이벤트에 끼어드는 구조다. 모드는 모델에 전달되기 전 프롬프트를 다시 쓰고, 도구 호출을 차단하거나 바꾸고, 권한 요청을 승인·거절하며, 도구 출력에서 비밀을 가릴 수 있다. 화면의 도구 결과와 질문을 교체하거나 새 버튼과 입력창을 추가하는 것도 가능하다. 인터페이스가 단순한 표시 계층이 아니라 에이전트 행동을 결정하는 실행 계층이 된 셈이다.

이 유연성은 개발자가 공급자의 출시 주기를 기다리지 않고 자기 작업 방식에 맞는 에이전트를 만들게 한다. 반대로 Anthropic은 Mods가 Claude Code와 같은 머신 접근 권한으로 실행되며 샌드박스되지 않는다고 명시한다. 신뢰하지 않는 모드는 일반 프로그램과 마찬가지로 설치하지 말아야 한다. ‘AI가 만들어 준 플러그인’도 결국 로컬에서 실행되는 코드라는 사실은 바뀌지 않는다.

기업용 환경에는 먼저 로드되는 `sec-default` 모드와 플러그인 마켓 허용·차단 같은 통제가 제공된다. 하지만 통제 모드 역시 로드 순서와 관리자 설정에 기대는 소프트웨어다. 팀이 검토해야 할 대상은 모델 프롬프트뿐 아니라 플러그인 출처, 이벤트 후킹 순서, 업데이트 경로, 감사 로그로 넓어진다.

DeepSeek와 Muse는 하네스를 화면 밖으로 확장한다

DeepSeek Harness는 ‘모든 것이 플러그인’인 오픈소스 실행 환경을 전면에 내세운다. 사용자는 데스크톱 앱이나 웹 UI에서 일상 문서 작업, 코딩, 조사, 백그라운드 작업을 처리하고, Creator mode에서 대화로 플러그인을 만들 수 있다. 아직 공개 프리뷰이고 핵심 플러그인과 API가 바뀔 수 있다는 점은 분명하지만, 모델 회사가 하네스 전체를 공개 생태계로 배포했다는 사실 자체가 중요하다.

Meta의 Muse Gadget SDK는 같은 논리를 물리 장치로 옮긴다. 개발자는 ESP32 보드나 Raspberry Pi를 Muse 앱과 연결하고, 화면·버튼·마이크 같은 입력과 센서·액추에이터를 에이전트의 도구로 만들 수 있다. TechCrunch가 확인한 것처럼 Meta는 펌웨어와 Linux SDK를 오픈소스로 제공한다. 에이전트 플러그인은 이제 메뉴나 명령어를 넘어 실제 공간의 입력과 동작을 다룬다.

이때 하네스는 제품의 편의 기능이 아니라 보안 경계가 된다. 어떤 플러그인이 네트워크를 쓰고, 어떤 장치 명령이 되돌릴 수 없으며, 어느 작업이 앱을 닫은 뒤에도 계속되는지가 모델 성능만큼 중요하다. 플러그인 생태계가 커질수록 설치 수보다 권한 설명, 격리, 서명, 업데이트 회수 능력이 제품의 신뢰를 결정한다.

Apple은 운영체제에서 다시 선을 긋는다

Apple은 macOS의 전체 디스크 접근이 원래 백업 앱을 위해 시스템 보호를 크게 우회하는 권한이라고 설명했다. 이 권한은 파일뿐 아니라 메일, 메시지, 브라우징 기록까지 노출할 수 있고, 통신 앱에서는 사용자와 대화한 다른 사람의 개인정보도 함께 영향을 받는다. Apple은 앞으로 이 수준의 접근을 허용할 때 ‘매우 명시적인’ 사용자 동작을 요구하는 추가 통제를 도입하겠다고 밝혔다.

발표는 추상적인 경고만이 아니다. 보안 연구자 Patrick Wardle은 Meta Muse의 인증 토큰과 음성 전사 엔드포인트 설정을 가로채 에이전트의 기존 권한을 공격자가 재사용할 수 있는 취약점을 공개했다. Ars Technica 보도 뒤 Meta는 핫픽스를 배포했다. 핵심은 취약점 하나의 수명이 아니라, 강력한 에이전트가 이미 가진 카메라·파일·메시지 권한이 공격자의 도구가 될 수 있다는 구조다.

플랫폼 사업자와 에이전트 사업자의 이해도 엇갈린다. 에이전트는 더 많은 맥락과 도구에 접근할수록 유용해지지만, 운영체제는 광범위한 권한을 한 번에 넘기는 방식을 줄여야 한다. 앞으로의 경쟁은 ‘무엇을 할 수 있는가’와 ‘그 일을 위해 무엇을 영구적으로 열어 두지 않아도 되는가’를 동시에 증명하는 쪽으로 이동할 것이다.

개발자는 확장 기능을 공급망으로 봐야 한다

에이전트 플러그인은 브라우저 확장 프로그램, 패키지 의존성, CI 작업, 운영 권한의 성격을 한꺼번에 가진다. 따라서 기능 설명만 읽고 설치해서는 부족하다. 소스와 배포 주체를 확인하고, 플러그인이 읽는 이벤트와 파일, 네트워크 목적지, 업데이트 권한을 목록화해야 한다. 모델이 플러그인을 작성했더라도 검토 책임은 사라지지 않는다.

권한은 작업 단위로 잘게 나누는 편이 낫다. 전체 디스크 접근이나 상시 실행을 기본값으로 두기보다 필요한 폴더·앱·세션에만 짧게 허용하고, 외부 전송·구매·삭제·배포처럼 되돌리기 어려운 행동에는 별도 승인을 둬야 한다. 도구 호출과 권한 결정, 플러그인 버전, 사용자 승인을 함께 기록해야 사고 뒤에 ‘모델이 했다’는 설명을 넘어서 원인을 찾을 수 있다.

하네스가 개방될수록 모델 교체는 쉬워질 수 있지만, 안전한 운영은 저절로 따라오지 않는다. 앞으로 좋은 AI 제품의 차이는 가장 똑똑한 모델 하나보다 검증된 확장 생태계, 최소 권한, 투명한 실행 기록, 빠른 회수 장치를 얼마나 자연스럽게 묶는지에서 생긴다. 에이전트 시대의 UX는 더 많은 자동화가 아니라, 자동화의 경계를 이해할 수 있게 만드는 일이다.

출처

마지막 수정: 2026. 10. 4.

다른 포스트

다음 포스트

다음 포스트가 없습니다