Kyurasi 큐라시

kyurasi.com/@kyurasi

오픈AI·메타·구글, AI를 ‘상시 작업자’로 다시 설계한다

OpenAI Dots와 Decisions API, Meta Muse, Gemini 4 Argon, Claude Sonnet 5.5를 통해 프론티어 AI가 상시 작업 시스템으로 수렴하는 흐름을 분석합니다.

오픈AI·메타·구글, AI를 ‘상시 작업자’로 다시 설계한다

오픈AI·메타·구글, AI를 ‘상시 작업자’로 다시 설계한다

📅
KyurasiKyurasi
1
#OpenAI#Meta#Google#Anthropic#AI에이전트#Dots#Gemini4#개발자도구
💡이 글의 요약

Dots와 Muse는 계속 일하고, Gemini 4와 Claude는 더 긴 작업을 버틴다. 프론티어 AI 경쟁이 챗봇에서 권한·기억·판단을 갖춘 작업 시스템으로 이동했다.

요약

프론티어 AI의 다음 경쟁은 더 유창한 대화가 아니다. 오픈AI의 Dots, 메타의 Muse, xAI의 Team Bots는 모두 사용자가 창을 닫은 뒤에도 일을 계속하고, 자체 컴퓨터와 연결된 앱을 사용하며, 필요한 순간에만 사람의 승인을 받는 작업자로 설계되고 있다. 이름과 유통 채널은 달라도 제품의 기본 단위가 대화 세션에서 지속되는 책임으로 바뀌었다는 점은 같다.

동시에 구글의 Gemini 4 Argon과 앤트로픽의 Claude Sonnet 5.5는 이 작업자를 떠받치는 모델 경쟁을 장기 실행, 코딩, 속도와 비용 쪽으로 밀고 있다. 오픈AI가 DevDay에서 공개한 Decisions API는 또 다른 중요한 조각이다. 에이전트가 매번 긴 문장을 생성하는 대신 정해진 선택지 안에서 판단하도록 분리한다. 이제 경쟁의 핵심은 하나의 거대한 모델이 아니라 기억, 권한, 실행 환경, 판단 모델과 검토 절차를 얼마나 안정적으로 결합하느냐다.

DevDay의 진짜 발표는 제품 목록이 아니라 하나의 운영체제다

오픈AI DevDay의 대표 제품은 Dots였지만, 발표 전체를 따로 떼어 보면 의미를 놓치기 쉽다. Dots는 GPT-6 Astra로 구동되는 상시 에이전트이고 자체 클라우드 컴퓨터와 브라우저를 가지며, 플러그인을 통해 여러 업무 앱에 연결된다. 사용자는 ChatGPT뿐 아니라 Slack과 Teams에서도 같은 에이전트와 대화하고, 에이전트가 수행 중인 작업을 직접 열어 볼 수 있다.

그 주변에는 Agents API의 컴퓨터 사용, Codex의 클라우드 실행, 팀의 공유 맥락을 보관하는 ChatGPT Space, 이벤트에 반응하는 플러그인 자동화가 배치됐다. 모델이 생각하고, 에이전트 런타임이 행동하며, 공간이 기억하고, 플러그인이 외부 시스템과 연결하는 구조다. Dots는 이 부품들을 소비자와 조직이 이해할 수 있는 하나의 정체성으로 포장한 인터페이스에 가깝다.

이 관점에서 DevDay는 새 챗봇 발표회가 아니라 에이전트 운영체제의 공개였다. 개발자가 직접 프롬프트 루프와 브라우저 자동화, 컨텍스트 보존, 다중 에이전트 조율을 모두 조립하던 단계에서 플랫폼이 실행 기반을 맡는 단계로 넘어가고 있다. 애플리케이션 개발의 차별점도 모델 호출 자체보다 어떤 책임을 위임하고 어떤 데이터와 도구를 허용할지로 이동한다.

Dots와 Muse가 닮은 이유

메타 Muse 역시 전용 클라우드 컴퓨터와 브라우저에서 동작하고, 연결된 앱을 오가며 장기 목표를 추진한다. 사용자가 앱을 닫아도 계속 일하고 이메일 전송이나 구매처럼 민감한 행동 전에는 승인을 요청한다. 전용 VM, 자격 증명 보관, 행동 기록을 제품의 핵심으로 내세운다는 점까지 Dots와 닮았다. xAI의 Team Bots도 파일, 앱, 팀의 지식과 기억을 한 작업자에 묶어 공동으로 사용하게 한다.

이 수렴은 우연한 기능 복사가 아니다. 에이전트가 실제 가치를 만들려면 세션이 끝나도 목표를 잊지 않아야 하고, 사람이 쓰는 도구에 로그인할 수 있어야 하며, 실패했을 때 무엇을 했는지 추적할 수 있어야 한다. 결국 프론티어 회사들이 해결해야 하는 제품 문제는 같은 네 가지로 좁혀진다. 지속성, 도구 접근, 개인화된 기억, 그리고 승인 가능한 행동이다.

차이는 유통과 신뢰의 출발점에 있다. 메타는 WhatsApp과 개인 생활의 연결성을, 오픈AI는 ChatGPT·업무 도구·개발자 생태계를, xAI는 팀 단위의 공유 작업자를 앞세운다. 그러나 승부는 누가 더 사람처럼 말하느냐가 아니라 누가 사용자의 권한을 더 세밀하게 나누고, 작업 상태를 더 잘 보여주며, 잘못된 행동을 더 쉽게 되돌리게 하느냐에서 갈릴 가능성이 크다.

Jev가 던진 질문에 OpenAI가 답했다

TypeSafe AI의 Jev가 주목받은 이유는 새로운 챗봇이어서가 아니다. Jev는 문장을 생성하지 않고, 개발자가 미리 정의한 선택·점수·확률 형태로 판단을 반환한다. 공급사가 주장하는 성능과 효율은 더 독립적인 검증이 필요하지만, 자유로운 문자열 대신 소프트웨어가 바로 검사할 수 있는 결과를 준다는 설계는 에이전트 개발의 실제 병목을 정확히 겨냥했다.

오픈AI가 DevDay에서 공개한 Decisions API도 같은 문제를 프론티어 플랫폼의 언어로 다시 제시했다. 개발자가 유한한 답을 정의하고 텍스트나 이미지 맥락을 넘기면 Luna의 지능을 분류, 라우팅, 다음 행동 선택에 사용한다. Jev와 내부 구조가 같다고 단정할 근거는 없지만, 생성과 판단을 분리하고 판단의 출력 공간을 제한한다는 제품 원리는 분명히 수렴한다.

이 변화는 개발자에게 꽤 실용적이다. 고객 문의 분류, 도구 선택, 승인 필요 여부, 다음 에이전트 결정처럼 경계가 있는 문제에 매번 가장 비싼 생성 모델을 투입할 필요가 줄어든다. 자유 생성 모델은 계획과 설명을 맡고, 제한된 판단 모델은 반복 결정을 맡으며, 일반 코드는 권한과 불변 조건을 지킨다. AI 애플리케이션이 하나의 모델을 감싼 UI에서 역할이 나뉜 시스템으로 진화하는 순간이다.

구글과 앤트로픽의 추격은 ‘오래 일하는 비용’ 경쟁이다

구글은 Gemini 4 Argon을 복잡하고 긴 소프트웨어 엔지니어링과 전문 업무에 맞춘 프론티어 모델로 발표했다. 최대 출력 한도를 100만 토큰으로 늘리고 장기 코딩과 사이버 방어 성능을 강조했지만, 현재 접근은 검증된 사이버 방어 파트너 중심으로 제한돼 있다. 공개 벤치마크 수치보다 중요한 사실은 구글이 단발성 답변이 아니라 하나의 긴 작업 궤적을 끝까지 유지하는 능력을 전면에 내세웠다는 점이다.

앤트로픽의 Claude Sonnet 5.5는 다른 방식으로 같은 시장을 겨냥한다. 회사는 Sonnet 5보다 30% 이상 빠르고 대부분의 작업에서 최대 30% 저렴하다고 밝혔으며, 코딩 에이전트가 더 적은 도구 호출과 토큰으로 일을 마치는 사례를 제시했다. 자체 평가와 초기 고객 사례라는 한계는 있지만, 상시 에이전트가 경제성을 가지려면 최고 성능 한 번보다 반복 작업의 지연과 비용이 더 중요하다는 점을 보여준다.

OpenAI의 GPT-6.1 Sol도 Astra에 가까운 코딩·컴퓨터 사용 능력을 더 낮은 가격에 제공하는 것을 핵심으로 내세웠다. 프론티어 연구소들이 동시에 장기 작업, 비용, 캐시, 속도를 강조하는 것은 에이전트가 데모를 넘어 하루 종일 여러 작업을 수행하기 시작했기 때문이다. 모델 순위보다 작업 한 건을 끝낼 때 드는 총비용과 실패 후 복구 비용이 더 중요한 지표가 된다.

개발자는 이제 프롬프트보다 경계를 설계해야 한다

상시 에이전트 시대의 핵심 개발 문서는 프롬프트 한 장이 아니다. 어떤 이벤트가 작업을 시작하는지, 어떤 앱과 데이터에 접근할 수 있는지, 얼마의 예산과 시간을 쓸 수 있는지, 어떤 행동은 사람의 승인을 받아야 하는지, 실패하면 어디까지 되돌릴지를 명시한 권한 계약이 필요하다. 에이전트의 기억도 편의를 위한 무한 저장소가 아니라 출처, 유효 기간, 삭제 가능성을 가진 데이터로 다뤄야 한다.

모델 선택 역시 한 번의 결론이 아니라 라우팅 문제가 된다. 긴 계획에는 강한 추론 모델, 반복 코딩에는 비용 효율적인 모델, 제한된 분류에는 Decisions API나 Jev 같은 판단 계층, 결제와 배포에는 결정론적 코드와 사람 승인을 배치할 수 있다. 모델을 바꾸기 쉬운 구조보다 책임을 바꾸기 어려운 구조가 더 중요하다.

관측 가능성도 제품 기능이 된다. 사용자는 에이전트가 현재 무엇을 하는지, 어떤 근거로 다음 행동을 골랐는지, 어떤 도구가 실패했는지 확인할 수 있어야 한다. Dots와 Muse가 작업 화면, 승인, 감사 기록을 강조하는 이유다. 지속적으로 일하는 AI는 눈에 덜 보일수록 편리하지만, 잘못됐을 때는 오히려 더 잘 보여야 한다.

AI의 단위가 답변에서 책임으로 바뀐다

이번 발표들을 관통하는 변화는 모델의 지능이 조금 더 높아졌다는 데 있지 않다. 사용자가 한 번 질문하고 답을 받는 구조에서, 목표를 맡기고 진행 상황과 예외만 확인하는 구조로 제품의 기본 단위가 바뀌고 있다. 프론티어 회사들은 각자 다른 브랜드를 내세우지만 자체 실행 환경, 장기 기억, 도구 연결, 제한된 판단, 사람의 승인이라는 거의 같은 설계에 도착했다.

그래서 다음 승자는 가장 화려한 데모를 만든 회사가 아닐 수 있다. 사용자가 안심하고 더 큰 책임을 맡길 수 있도록 권한과 비용, 기억과 실패를 관리하는 회사가 유리하다. 개발자에게도 기회는 모델 자체를 흉내 내는 데 있지 않다. 특정 업무의 책임 경계를 가장 잘 정의하고, 여러 모델과 도구를 그 경계 안에서 안전하게 움직이게 만드는 제품이 AI의 다음 인터페이스가 될 것이다.

출처

마지막 수정: 2026. 10. 1.