메타가 Llama 시리즈에 이어 새로운 에이전트 특화 오픈웨이트 모델 'Muse Glimmer' 30B 가중치를 Apache 2.0 라이선스로 전격 공개했다. 클라우드 API 모델인 Muse Spark의 출력을 증류(distillation)해 학습된 이 모델은, 4비트 양자화 적용 시 20GB 미만의 메모리로 언어 모델 본체를 올릴 수 있어 단일 RTX 4090(24GB)이나 Apple Silicon Mac(32GB) 환경에서 온디바이스 멀티모달 에이전트를 독립 구동할 수 있다.

먼저 답하면

  • 추천 작업: 사내망 격리 환경에서 외부 API 유출 없이 문서 파싱, 시각 분석, 로컬 툴 호출을 수행하는 사내 온프레미스 에이전트
  • 비추천 작업: 복잡한 수십 단계의 프런티어 코딩 문제 해결이나 초대형 프로젝트 전역 리팩토링
  • 현재 판단: Muse Glimmer는 클라우드 구독 비용 없이 상업용 서비스에 자유롭게 내장할 수 있는 가장 균형 잡힌 30B 로컬 에이전트 모델이다. 비전 인코더와 초안 모델(draft model)을 함께 올려도 24GB~32GB VRAM 안에서 안정적으로 수용 가능해, 프라이버시가 핵심인 엔터프라이즈 로컬 인프라 구축에 최적이다.

정확히 어떤 모델인가

항목 확인된 내용
공급자 Meta AI
공식 제품명 Muse Glimmer (30B)
라이선스 Apache 2.0 (상업적 이용 및 수정 배포 완전 허용)
가중치 형태 오픈웨이트 (Hugging Face 공개)
컨텍스트 128,000 토큰
최대 출력 16,000 토큰
구동 요구사항 4비트 양자화 기준 VRAM 18~20GB (권장: 24GB VRAM GPU 또는 32GB 통합 메모리 Mac)
입출력 형식 텍스트·이미지 입출력
주요 기능 도구 호출(Tool Calling), 구조화 출력(Structured Outputs), 온디바이스 시각 추론, Speculative Decoding 초안 지원

Muse Glimmer는 Llama 4 이후 약 16개월 만에 나온 메타의 오픈웨이트 중형 모델이다. 상위 모델인 Muse Spark의 고품질 합성 에이전트 궤적(trajectory) 데이터를 지도학습 데이터로 삼아 파라미터 크기 대비 도구 호출 성공률과 컨텍스트 유지력을 크게 높였다.

벤치마크에서 확인되는 위치

벤치마크 Muse Glimmer (30B) Llama-3.3-70B-Instruct Qwen3.6-27B
Tool Calling Accuracy 88.4% 84.2% 86.1%
Visual Agent Bench 74.2% - (별도 비전 모델 필요) 71.8%
HumanEval-Agent 71.5% 73.0% 72.8%
4-bit 양자화 VRAM 요구량 ~18.5 GB ~39.0 GB ~17.2 GB

70B급 모델인 Llama-3.3 대비 절반 이하의 파라미터로 도구 호출 및 시각 에이전트 평가에서 대등하거나 오히려 앞선 점수를 기록했다. 네이티브 멀티모달 아키텍처 덕분에 별도의 비전 어댑터를 붙이지 않고도 화면 UI 인식과 이미지 기반 도구 제어가 가능하다.

가격과 실제 선택 조건

가중치 파일이 완전히 무료로 배포되므로 API 호출 비용은 $0이다. 다만 하드웨어 및 운영 인프라 비용을 고려해야 한다.

  1. 단일 24GB GPU 수용: AWQ / EXL2 4비트 양자화 시 모델 본체 약 16.5GB, 비전 인코더 약 2.5GB로 총 19GB 수준에서 로드된다. 컨텍스트 32k 기준 약 22GB VRAM으로 1장의 RTX 4090 또는 A10G에서 단독 구동이 가능하다.
  2. Mac 환경 적합성: M2/M3/M4 Max 이상의 36GB/48GB 통합 메모리 장비에서 llama.cpp나 Ollama를 통해 초당 35~45토큰 수준의 쾌적한 로컬 작업이 가능하다.

가장 가까운 대안

선택지 대안이 나은 상황 Muse Glimmer를 고를 이유
DeepSeek-V4-Flash 로컬 서버 구축 없이 클라우드 API로 초저가($0.14/$0.28) 대량 처리를 원할 때 데이터가 절대 사외로 반출되어서는 안 되는 폐쇄망 로컬 에이전트 구현
Qwen3.6-27B 한국어/동아시아 다국어 텍스트 중심의 순수 언어 처리 네이티브 비전 이해와 결합된 오픈소스 Apache 2.0 라이선스 기반 에이전트

최종 총평

Muse Glimmer는 폐쇄망 로컬 에이전트를 구축하려는 기업과 개발자에게 가장 현실적인 30B 오픈웨이트 솔루션이다. Apache 2.0 라이선스의 완전한 자유도와 24GB VRAM 1장으로 수용 가능한 경량화 설계는 온디바이스 에이전트 생태계의 핵심 기둥이 될 것이다.

출처