결론부터 말하면 Muse Spark 1.1은 긴 멀티모달 에이전트를 검증할 공개 후보가 됐지만, 곧바로 프로덕션 기본 모델로 둘 단계는 아니다. Meta는 2026년 7월 9일 Muse Spark 1.1과 함께 새 Meta Model API를 public preview로 열었다. 첫 Muse Spark가 일부 사용자를 위한 private API preview에 머문 것과 비교하면 개발자가 직접 에이전트 구조를 시험할 수 있는 배포 면이 생겼다.
제품 방향은 분명하다. 100만 토큰 컨텍스트를 능동적으로 관리하면서 외부 도구, MCP 서버, 사용자 정의 스킬, 컴퓨터 사용, 코딩과 멀티모달 이해를 긴 작업 안에서 묶는 모델이다. Meta는 메인 에이전트가 계획하고 병렬 서브에이전트에 실행을 나누며, 화면 조작과 스크립트 자동화를 상황에 따라 선택하도록 훈련했다고 설명한다.
다만 public preview는 정식 운영 보증과 같은 말이 아니다. 지정된 공개 발표와 보고서에는 토큰 단가가 없고, 이 글의 공개 검토 범위에서는 안정적으로 교차 확인할 수 있는 API ID도 없어 공식 미공개로 둔다. 이 글은 직접 사용기가 아니며 Meta 공식 자료의 주장과 평가 설계를 바탕으로 도입 조건을 판단한다.
먼저 답하면
- 추천: 영상·이미지·오디오·문서와 외부 도구를 오가며 오래 실행되는 에이전트를 public preview에서 평가하려는 팀
- 비추천: 확정 단가, 고정 SLA, 안정된 호출 계약이 먼저 필요한 프로덕션 서비스
- 1.0과의 차이: 첫 Muse Spark의 private API preview가 Muse Spark 1.1에서 Meta Model API public preview로 넓어졌다.
- 가격값: 공식 단가가 확인되지 않아 계산할 수 없다. 완수율, 사람 개입 횟수, 총 실행시간과 토큰 사용량을 함께 기록한 뒤 판단해야 한다.
- 도입 기준: 100만 토큰이라는 숫자보다 긴 세션에서 중요한 상태를 보존하고 도구 오류에서 회복하는지를 대표 업무로 확인해야 한다.
첫 공개 Model API가 바꾼 것
| 구분 | Muse Spark | Muse Spark 1.1 |
|---|---|---|
| 발표일 | 2026-04-08 | 2026-07-09 |
| API 공개 범위 | 일부 사용자를 위한 private preview | 새 Meta Model API public preview |
| 앱 제공 | meta.ai·Meta AI 앱 | meta.ai·Meta AI 앱의 Thinking 모드 |
| 공식 위치 | Muse 계열의 첫 모델 | 첫 모델을 잇는 최신 1.1 업데이트 |
| 공식 설명 | 네이티브 멀티모달 추론, 도구 사용, 멀티에이전트 오케스트레이션 | 에이전트·컴퓨터 사용·코딩·멀티모달 이해 개선 |
| 컨텍스트 | 지정 발표에서 수치 미공개 | 100만 토큰 |
| API ID | 공식 미공개 | 공식 미공개 |
| 토큰 단가 | 공식 미공개 | 공식 미공개 |
첫 버전 발표는 장기 에이전트와 코딩 워크플로를 당시의 성능 공백으로 직접 적었다. 1.1 발표는 바로 그 영역의 개선을 전면에 놓는다. 복잡한 프로젝트에서 메인 에이전트가 맥락을 모으고 계획을 세운 뒤 병렬 서브에이전트에 실행을 위임하며, 서브에이전트는 맡은 범위를 지키고 필요할 때 상위 에이전트로 되돌리는 구조다.
공개 범위의 변화도 중요하다. 1.0의 private preview에서는 외부 팀이 같은 조건으로 모델을 평가하기 어려웠다. 1.1의 public preview는 개발자가 도구·함수 호출과 자체 에이전트 스캐폴드를 붙여 실제 워크플로를 설계할 수 있게 한다. 공개 API가 생겼다는 사실 자체가 성능 보증은 아니지만, 내부 앱의 데모를 넘어 반복 가능한 평가를 만들 수 있는 출발점은 된다.
이 글의 Muse Spark 1.1은 첫 Muse Spark인 1.0과 동일한 체크포인트가 아니다. Muse Glimmer의 규격·라이선스·로컬 실행 정보를 1.1에 가져오지도 않는다. 세 이름을 섞으면 공개 방식과 평가 결과가 모두 달라진다.
100만 토큰은 저장 용량보다 운영 방식에 가깝다
Meta는 Muse Spark 1.1이 100만 토큰 컨텍스트를 능동적으로 관리한다고 설명한다. 앞선 작업을 기억하고 오래전 정보를 다시 찾으며, 이후 단계에 필요한 내용을 남기는 방식으로 컨텍스트를 압축한다는 주장이다.
긴 에이전트에서는 단순히 입력을 많이 넣는 것보다 이 관리가 더 중요하다. 작업 중 새 요구사항이 생기고 여러 앱의 상태가 바뀌면 모델은 처음 계획을 수정해야 한다. Meta가 제시한 컴퓨터 사용 예시도 모든 단계를 클릭으로 처리하지 않는다. 자동화가 빠른 구간은 스크립트를 쓰고, 직접 조작이 단순한 구간은 인터페이스를 사용하며, 여러 동작을 한 번에 생성하도록 훈련했다고 밝힌다.
멀티모달도 인식만 하는 기능으로 설명되지 않는다. 시각·오디오 정보를 긴 작업 동안 유지하고, 그 정보를 바탕으로 컴퓨터를 조작하는 지각-행동 결합이 중심이다. 영상에서 필요한 장면을 찾고 상품 정보를 구성한 뒤 브라우저에서 등록 작업을 이어가는 공식 예시는 이런 방향을 보여준다.
하지만 100만 토큰이 곧 100만 토큰 전체의 정확한 기억을 뜻하지는 않는다. 공개 발표에는 위치별 회상률, 압축 후 정보 손실률, 긴 세션의 지연시간과 비용이 없다. 실제 도입에서는 초반에 준 제약을 후반까지 지키는지, 압축 뒤 근거를 다시 찾는지, 도구 실패 후 상태를 복구하는지를 따로 측정해야 한다.
평가 보고서에서 읽을 수 있는 범위
Meta의 1.1 평가 보고서는 에이전트, 코딩, 멀티모달 이해와 추론을 함께 비교한다. Muse Spark 1.1 결과는 Meta Model API에서 xhigh reasoning effort로 실행됐다. 비교 모델은 Gemini 3.1 Pro의 high, Claude Opus 4.8의 max, GPT-5.5의 xhigh를 사용했다. 코딩·에이전트 평가는 공개된 자체 보고 점수를 우선 사용하고, 없을 때 내부 평가를 실행하는 방식이다.
이 조건은 순위를 읽을 때 중요하다. reasoning effort와 하네스가 완전히 같지 않고, 보고서도 타사 모델에 맞게 특별히 튜닝한 환경이 아니어서 해당 모델의 최고 성능을 반영하지 못할 수 있다고 적는다. 따라서 여러 벤치마크를 합쳐 하나의 종합 순위를 만들 수 없다.
코딩에서는 수치 하나를 분명하게 확인할 수 있다. Muse Spark 1.1은 SWE-Bench Verified Hard의 고유 과제 42개 가운데 24개를 적어도 한 번 해결했다. 이는 pass@1 57.1%라는 뜻이 아니다. 여러 시도 중 한 번이라도 해결한 고유 과제 수이므로 다른 pass@1 결과와 직접 비교하면 안 된다.
보고서는 동시에 한계도 남긴다. Terminal-Bench 2.1과 SWE-Bench Pro에서는 Claude Opus 4.8 또는 GPT-5.5보다 뒤처졌고, DeepSWE와 DeepSearchQA 같은 장기 에이전트 과제에서는 최고 성능 모델보다 낮거나 비슷했다고 요약한다. 1.0보다 나아졌다는 발표와 모든 코딩·에이전트 과제에서 앞선다는 주장은 서로 다른 말이다.
public preview에서 확인할 운영 항목
1. 한 요청이 아니라 한 프로젝트로 평가하기
멀티에이전트 오케스트레이션의 이점은 한 번의 답변 점수보다 전체 프로젝트 완수시간에서 나타나야 한다. 메인 에이전트와 서브에이전트가 만든 총 토큰, 병렬 실행의 임계 경로, 재시도 횟수, 사람이 개입한 횟수와 최종 산출물 통과 여부를 함께 기록해야 한다.
2. 컨텍스트 압축 전후의 상태를 검사하기
긴 세션 중간에 요구사항을 바꾸고, 초반의 제약을 후반에 다시 확인하며, 오래된 근거를 찾아야 하는 테스트를 넣는 편이 좋다. 100만 토큰을 채우는 부하 테스트만으로는 능동적 컨텍스트 관리의 품질을 알 수 없다.
3. 화면 조작과 스크립트의 경계를 남기기
모델이 클릭보다 스크립트를 선택하면 빨라질 수 있지만 권한 범위도 넓어진다. 파일·브라우저·외부 서비스별 허용 도구를 제한하고, 실행 로그와 변경 내용을 검토할 수 있어야 한다. 화면 상태가 달라졌을 때 계획을 수정했는지도 별도 실패 유형으로 기록해야 한다.
4. public preview의 계약을 가정하지 않기
지정된 공개 자료만으로는 Muse Spark 1.1의 확정 API ID, 토큰 단가, 사용량 티어별 한도, 지연시간 보장과 정식 출시 조건을 확인할 수 없다. Meta Model API 공식 문서 주소는 존재하지만 비로그인 공개 본문으로 세부 계약을 교차 확인하지 못했다. 비용표와 호출 계약을 제품 코드에 고정하기 전에 계정에 표시되는 최신 공식 조건을 다시 확인해야 한다.
추천 대상 / 비추천 대상
추천 대상
- 여러 앱과 외부 도구를 오가는 장기 멀티모달 에이전트를 평가하는 팀
- MCP 서버, 사용자 정의 스킬과 병렬 서브에이전트의 역할 분리를 시험하려는 개발 조직
- 큰 코드베이스의 버그 수정·기능 구현·마이그레이션을 프로젝트 단위로 측정할 수 있는 팀
- public preview의 변경 가능성을 감수하고 별도 평가 환경과 도구 권한 통제를 운영할 수 있는 팀
비추천 대상
- 확정 단가와 월 비용 상한이 없으면 도입 결정을 할 수 없는 서비스
- 고정 SLA와 장기 지원되는 호출 계약이 필요한 핵심 프로덕션 경로
- 100만 토큰을 넣으면 장기 기억과 정확도가 자동으로 해결된다고 보는 설계
- Meta의 자체 평가만으로 한국어 업무, 사내 도구와 코드베이스의 성공률을 확정하려는 도입
- Muse Spark 1.0, Muse Spark 1.1과 Muse Glimmer의 사양을 같은 모델처럼 섞는 카탈로그
가격값은 아직 계산할 수 없다
지정된 공식 공개 자료에는 Muse Spark 1.1의 입력·출력 토큰 단가가 없다. 가격 페이지에서 확인하지 못한 숫자를 다른 Meta 모델이나 경쟁 모델의 요금으로 채울 수 없다. 따라서 월간 1,000만 토큰 같은 가정을 넣어 비용을 계산하거나 경쟁 모델보다 싸다고 결론 내리지 않는다.
public preview 평가에서는 비용 항목을 비워 두지 말고 확인 대기로 관리하는 편이 낫다. 실제 계정에서 공식 단가와 과금 단위를 확인한 뒤 입력, 출력, reasoning, 도구 호출과 병렬 서브에이전트 비용을 나눠 기록해야 한다. 그 전에는 성공한 작업당 비용도 계산할 수 없다.
가격값이 생기는 조건은 긴 작업을 더 적은 사람 개입과 짧은 총시간으로 끝내는 경우다. 반대로 공개 단가가 없고, 재시도와 병렬 호출이 늘며, 사람이 결과를 계속 복구해야 한다면 100만 토큰과 public API라는 사양만으로 가격값을 주장할 수 없다.
안전은 공식 보고서의 결론까지만 본다
Meta의 평가 보고서는 배포 완화 조치를 적용한 뒤 화학·생물, 사이버보안, 통제 상실 영역의 residual risk를 모두 moderate or lower로 낮췄다고 정리한다. 이 글은 이중용도 화학·생물 및 공격 사이버 점수표를 재생하지 않는다. 평가 설계, 완화 조치와 제한 사항은 Muse Spark 1.1 평가 보고서에서 확인할 수 있다.
아직 공식 공개 자료에서 확인되지 않은 부분
- 안정적으로 교차 확인할 수 있는 Muse Spark 1.1 API ID
- 입력·출력·reasoning·도구 호출의 공식 단가와 과금 단위
- 사용량 티어별 rate limit, 지연시간 보장과 public preview 종료 조건
- 100만 토큰 컨텍스트의 위치별 회상률과 압축 후 정보 손실률
- 동일 하네스·추론 예산으로 측정한 한국어, 코딩, 컴퓨터 사용과 장기 에이전트 비교
함께 읽을 글
근거와 출처
- Introducing Muse Spark 1.1 — 2026-07-09 발표, Meta Model API public preview, Thinking 모드, 100만 토큰 컨텍스트와 에이전트·컴퓨터 사용·코딩·멀티모달 설명. Meta AI, 확인일 2026-08-26
- Introducing Muse Spark — 2026-04-08 첫 모델 발표, private API preview, 멀티모달·도구 사용·멀티에이전트 구조와 당시 장기 에이전트·코딩 공백. Meta AI, 확인일 2026-08-26
- Muse Spark 1.1 Evaluation Report — 일반 능력 평가 방법, 에이전트·코딩 평가 범위, SWE-Bench Verified Hard 24/42와 완화 후 residual risk 결론. Meta, 확인일 2026-08-26
- Meta Model API 공식 문서 — 공식 문서 진입점. 비로그인 공개 본문에서는 세부 API 계약을 확인할 수 없어 ID·단가를 만들지 않음. Meta for Developers, 확인일 2026-08-26
게시: 2026-08-26 21:30 KST 작성 방식: 직접 사용기가 아닌 Meta 공식 발표·평가 보고서 분석
독자 의견
댓글 0
글에 대한 생각과 경험을 남겨 주세요. 서로를 존중하는 표현을 부탁드립니다.