이번 업데이트는 단순히 또 하나의 챗봇을 조금 더 똑똑하게 만드는 데 초점을 맞춘 것이 아닙니다.
핵심은 AI가 실제 업무를 끝까지 완료하는 능력을 높이는 것입니다.
9월 2일 공개된 Muse Spark 1.3은 장시간 실행되는 AI 에이전트, 코딩, 도구 사용, 장문 컨텍스트, 복잡한 워크플로우를 중심으로 성능이 개선됐습니다.
Meta에 따르면 Muse Spark 1.2보다 효율성도 높아졌습니다. 자체 엔지니어 테스트에서는 약 20% 적은 도구 호출과 25% 적은 토큰을 사용했습니다.
이번 업데이트에서 가장 실용적인 변화 중 하나일 수 있습니다.
Muse Spark 1.3이란?
Muse Spark 1.3은 Meta의 Muse Spark 제품군에서 가장 최신 모델입니다.
한 번의 프롬프트와 한 번의 답변만으로 끝나지 않는 작업을 위해 설계됐습니다.
주요 활용 분야는 다음과 같습니다.
- 장시간 실행되는 AI 에이전트
- 소프트웨어 엔지니어링
- 리서치 및 웹 브라우징
- Computer Use
- 비즈니스 자동화
- 장문 컨텍스트 정보 검색
- 복잡한 문서 워크플로우
Muse Spark 1.3은 현재 Muse Code와 Meta Model API에서 사용할 수 있습니다.
또한 100만 토큰 컨텍스트 윈도우를 지원합니다.
대규모 코드베이스, 긴 문서, 여러 파일, 장시간 진행되는 에이전트 세션을 한 번에 처리할 수 있는 수준입니다.
하지만 가장 큰 변화는 단순히 많은 정보를 담을 수 있다는 점이 아닙니다.
그 정보를 긴 작업 과정에서 얼마나 안정적으로 활용할 수 있는지가 더 중요합니다.
Muse Spark 1.3은 더 긴 AI 워크플로우에 초점을 맞췄다
AI 에이전트의 대표적인 문제 중 하나는 작업이 길어질수록 처음 목표에서 벗어나는 것입니다.
처음에는 목표를 정확하게 이해하고 여러 단계를 제대로 수행하더라도, 시간이 지나면서 중요한 조건을 잊는 경우가 있습니다.
Muse Spark 1.3은 이런 문제를 줄이는 데 초점을 맞췄습니다.
Meta는 새로운 모델이 긴 작업에서도 세부 지시사항을 더 잘 유지하고, 정리되지 않았거나 서로 충돌하는 정보도 더 안정적으로 처리한다고 설명합니다.
자체 계획의 빈틈을 수정하고, 이미 파악한 정보를 계속 추적하는 능력도 개선됐습니다.
같은 긴 대화 안에서 여러 워크플로우를 처리하더라도 새로운 요청과 이전 작업을 혼동할 가능성이 줄었습니다.
원본 파일에서 최종 결과물까지
Meta가 공개한 사례를 보면 일반적인 AI 채팅과 어떤 차이가 있는지 쉽게 알 수 있습니다.
한 테스트에서 Muse Spark 1.3은 주민 피드백이 담긴 Excel 파일을 전달받았습니다.
그리고 이 데이터를 직원들이 이사회 회의에서 바로 사용할 수 있는 자료로 만들라는 요청을 받았습니다.
결과물은 채팅창 안의 간단한 요약이 아니었습니다.
핵심 논의 포인트, 주요 수치, 지역별 가이드, 직원들이 사용할 수 있는 표현, 약속하면 안 되는 내용 등을 포함한 구조화된 PDF를 생성했습니다.

Muse Spark 1.3이 원본 데이터를 구조화된 직원용 논의 자료로 변환한 예시. 출처: Meta AI Research.
이는 AI 에이전트가 앞으로 어떤 방향으로 발전할지 잘 보여줍니다.
기존에는:
프롬프트 → 답변
이었다면,
이제는:
파일 → 이해 → 분석 → 정리 → 생성 → 결과 전달
형태로 발전하고 있습니다.
실제 업무에서는 이 차이가 매우 중요합니다.
Muse Spark 1.3은 더 복잡한 멀티모달 작업도 처리한다
긴 워크플로우는 스프레드시트나 문서에만 해당하지 않습니다.
Meta의 또 다른 사례에서는 Muse Spark 1.3이 실험용 항공기 조립을 담당하는 기계 엔지니어 역할을 수행합니다.
모델은 초기 CFD 시뮬레이션 결과와 CAD 모델이 포함된 STEP 파일을 전달받습니다.
이후 데이터를 해석하고, 시뮬레이션 환경을 설명하고, 엔지니어링 지표를 추출하고, 표와 다이어그램을 만들고, 공기역학적 의미를 분석한 뒤 최종 PDF 보고서까지 만들어야 합니다.
완성된 문서에는 기술 설명, 시각화, 표, 차트, 엔지니어링 배경 정보가 함께 포함됩니다.

엔지니어링 원본 파일을 기반으로 Muse Spark 1.3이 생성한 기술 시뮬레이션 보고서 예시. 출처: Meta AI Research.
이 사례는 최근 말하는 “멀티모달 에이전트”가 무엇을 의미하는지도 잘 보여줍니다.
단순히 이미지를 인식하거나 PDF를 요약하는 것으로는 충분하지 않습니다.
실용적인 에이전트라면 여러 종류의 입력을 이해하고, 중요한 세부 정보를 유지하고, 서로 다른 자료를 연결해 분석한 뒤 사람이 바로 활용할 수 있는 결과물로 만들어야 합니다.
Muse Spark 1.3 벤치마크
Meta는 Muse Spark 1.3을 크게 세 가지 영역에서 평가했습니다.
- AI 에이전트
- 장문 컨텍스트
- 코딩
전반적인 결과는 강력하지만, 모든 벤치마크에서 1위를 기록한 것은 아닙니다.

Muse Spark 1.3의 에이전트 워크플로우, 장문 컨텍스트, 코딩 벤치마크 결과. 출처: Meta AI Research.
AI 에이전트 성능
장시간 Computer Use 워크플로우를 평가하는 OSWorld 2.0에서 Muse Spark 1.3은 다음 점수를 기록했습니다.
66.9
Muse Spark 1.2의 47.6에서 크게 상승했으며, GPT-5.6 Sol의 62.7보다 높습니다.
Claude Opus 5는 68.3으로 소폭 앞섰습니다.
다른 점수는 다음과 같습니다.
- JobBench: 64.9
- DeepSearchQA: 89.4
- Meta Agentic IF Index: 57.8
- AutomationBench: 49.4
중요한 점은 Muse가 모든 평가에서 1위를 했다는 것이 아닙니다.
더 눈에 띄는 부분은 다양한 에이전트 작업에서 Muse Spark 1.2보다 꾸준히 개선됐다는 점입니다.
장문 컨텍스트 성능은 큰 폭으로 개선
장문 컨텍스트 성능은 특히 눈에 띕니다.
MRCR 결과는 다음과 같습니다.
| Benchmark | Muse Spark 1.3 | Muse Spark 1.2 | GPT-5.6 Sol |
|---|---|---|---|
| MRCR 256K–512K | 98.5 | 66.3 | 91.5 |
| MRCR 512K–1M | 98.1 | 55.5 | 73.8 |
Muse Spark 1.2와 비교하면 매우 큰 상승폭입니다.
100만 토큰 컨텍스트 윈도우는 단순히 크기만 커서는 의미가 없습니다.
컨텍스트 깊은 곳에 있는 정보를 정확히 찾고 활용할 수 있어야 합니다.
이번 결과를 보면 Meta는 최대 컨텍스트 길이를 늘리는 것뿐 아니라 긴 컨텍스트 안에서 정보를 검색하는 능력도 크게 개선한 것으로 보입니다.
대규모 코드베이스, 리서치 자료, 긴 대화, 문서 중심의 AI 에이전트에 특히 유용할 수 있습니다.
코딩 성능도 향상
Muse Spark 1.3은 여러 코딩 평가에서도 좋은 성능을 보였습니다.
장시간 소프트웨어 엔지니어링 작업을 평가하는 DeepSWE v1.1에서는 75.4를 기록했습니다.
비교하면:
- Muse Spark 1.2: 55.0
- GPT-5.6 Sol: 73.0
- Claude Opus 5: 74.0
SWEAtlas CodeBase QnA에서는 59.4를 기록해 Meta가 공개한 비교 모델 중 가장 높은 점수를 보였습니다.
Terminal-Bench 2.1에서는 Muse Spark 1.3과 GPT-5.6 Sol이 모두 88.8, Claude Opus 5는 86.7을 기록했습니다.
이 결과는 이번 업데이트의 핵심 방향과 잘 맞습니다.
한 번의 코드 생성이 아니라 여러 단계를 거쳐야 하는 코딩 작업에서 Muse Spark 1.3이 훨씬 강해졌습니다.
다만 한 가지 주의할 점이 있습니다.
Meta가 공개한 벤치마크에서는 Muse Spark 1.3의 Max Reasoning 설정을 사용했습니다.
출시 시점에는 기존 추론 모드를 바로 사용할 수 있지만, Max Reasoning은 추가 안전성 테스트 이후 제공될 예정입니다.
따라서 공개된 벤치마크 결과가 현재 이용 가능한 모든 설정에서 동일하게 나타난다고 볼 수는 없습니다.
Muse Spark 1.3은 도구 호출도 줄였다
벤치마크도 중요하지만, 실제 사용에서는 순위표에 나오지 않는 변화가 더 의미 있을 수 있습니다.
Meta에 따르면 Muse Spark 1.3은 Muse Spark 1.2 대비 약:
- 20% 적은 도구 호출
- 25% 적은 토큰 사용
으로 작업을 완료합니다.
불필요한 단계를 덜 거치고, 코드도 덜 장황하게 생성하는 경향이 있습니다.
왜 중요할까요?
예를 들어 코딩 에이전트가 버그를 수정한다고 가정해 보겠습니다.
비효율적인 작업 방식은 다음과 같을 수 있습니다.
검색 → 확인 → 다시 검색 → 수정 → 확인 → 되돌리기 → 검색 → 수정 → 테스트 → 다시 수정
더 좋은 에이전트라면 문제를 일찍 파악하고 더 적은 행동만으로 같은 결과를 얻을 수 있습니다.
불필요한 도구 호출은 시간과 비용을 늘립니다.
실패할 수 있는 단계도 그만큼 많아집니다.
이런 효율성은 코딩뿐 아니라 리서치 에이전트, 브라우저 에이전트, 비즈니스 자동화, 개인 AI 비서에서도 중요합니다.
Muse Spark 1.3 가격
Meta Model API에서는 Muse Spark 1.3을 두 가지 가격 옵션으로 제공합니다.
두 모델 모두 100만 토큰 컨텍스트를 지원합니다.

Meta Model API의 Muse Spark 1.3 가격. 출처: Meta.
일반 Muse Spark 1.3
muse-spark-1.3의 가격은 다음과 같습니다.
| 사용량 | 100만 토큰당 가격 |
|---|---|
| 입력 | $1.25 |
| 캐시 입력 | $0.15 |
| 출력 | $4.25 |
Meta는 이 버전이 자사 제품 개선에 사용되지 않는다고 표시하고 있습니다.
Muse Spark 1.3 Contributor
더 저렴한 옵션으로:
muse-spark-1.3-contributor
도 제공됩니다.
| 사용량 | 100만 토큰당 가격 |
|---|---|
| 입력 | $0.10 |
| 캐시 입력 | $0.002 |
| 출력 | $0.20 |
하지만 중요한 차이가 있습니다.
Meta는 Contributor 버전을 자사 제품 개선에 사용한다고 명시합니다.
가격은 매우 저렴하지만, 데이터 처리나 개인정보 보호가 중요한 환경에는 적합하지 않을 수 있습니다.
개발자는 단순한 토큰 가격 외에 데이터 정책까지 함께 확인할 필요가 있습니다.
Muse Spark 1.3 vs Muse Spark 1.2
이번 업데이트는 하나의 화려한 기능보다는 전체 워크플로우를 개선하는 데 초점이 맞춰져 있습니다.
| 기능 | Muse Spark 1.2 | Muse Spark 1.3 |
|---|---|---|
| 장시간 에이전트 | 강력 | 더 안정적 |
| 긴 지시사항 유지 | 우수 | 개선 |
| 멀티태스킹 | 가능 | 작업 분리 개선 |
| 도구 사용 | 강력 | 더 효율적 |
| 도구 호출 | 기준 | Meta 테스트에서 약 20% 감소 |
| 토큰 사용 | 기준 | 약 25% 감소 |
| 장문 컨텍스트 검색 | 우수 | 큰 폭 개선 |
| 코딩 | 강력 | 장시간 작업에서 개선 |
| 확인 질문 | 지원 | 더 적극적 |
한 문장으로 정리하면:
Muse Spark 1.3은 불필요한 작업을 줄이면서 더 복잡한 업무를 처리할 수 있게 됐습니다.
언제 행동하지 말아야 하는지도 더 잘 판단한다
눈에 잘 띄지 않지만 실제 에이전트 운영에서는 중요한 개선도 있습니다.
Muse Spark 1.3은 사용자와 더 적극적으로 협업하도록 학습됐습니다.
프롬프트가 모호하면 추가 설명을 요청할 수 있습니다.
작업 중 막히면 사용자에게 도움을 요청할 수 있습니다.
중요한 행동을 실행하기 전에는 사용자가 정말 원하는 것이 맞는지 먼저 확인할 가능성도 높아졌습니다.
Meta는 모델이 자신이 무엇을 알고 무엇을 모르는지, 언제 한계에 도달했는지를 더 잘 판단한다고 설명합니다.
결과를 억지로 만들어내기보다 필요할 때 멈출 수 있는 에이전트가 실제 업무에서는 더 신뢰할 만할 수 있습니다.
Muse Spark 1.3은 오픈소스인가?
아직은 아닙니다.
현재 Muse Spark 1.3은 Meta 자체 서비스를 통해 제공되며 Open Weights 모델로 공개되지는 않았습니다.
다만 Meta는 향후 Muse Spark Open Weights 버전을 공개할 계획이라고 밝혔습니다.
구체적인 출시 일정은 아직 발표되지 않았습니다.
Meta의 호스팅 API 밖에서 Muse Spark를 실행하거나 커스터마이징하고 싶은 개발자에게 중요한 변화가 될 수 있습니다.
Muse Spark 1.3은 어디에서 사용할 수 있나?
현재 Muse Spark 1.3은 다음 경로로 사용할 수 있습니다.
- Muse Code
- Meta Model API
Muse Code는 AI 에이전트 기반 코딩 환경을 원하는 개발자에게 적합합니다.
Meta Model API는 Muse Spark를 자체 제품이나 워크플로우에 통합하려는 개발자를 위한 선택지입니다.
현재 가장 잘 맞는 활용 사례는 다음과 같습니다.
- 코딩 에이전트
- 리서치 에이전트
- Computer Use 에이전트
- 기업 자동화
- 대규모 문서 워크플로우
- 장시간 작업
- 멀티모달 분석
- 100만 토큰 컨텍스트가 필요한 애플리케이션
Muse Spark 1.3이 일상적인 AI 업무에 의미하는 것
Muse Spark 1.3은 AI 업계에서 일어나고 있는 더 큰 변화를 보여줍니다.
그동안 AI 모델을 평가할 때 가장 중요한 질문은 주로 하나였습니다.
답변이 얼마나 좋은가?
AI 에이전트 시대에는 더 많은 질문이 필요합니다.
파일을 제대로 이해하는가?
요구사항을 계속 기억하는가?
적절한 도구를 선택하는가?
문제가 발생했을 때 복구할 수 있는가?
최종 결과물까지 만들 수 있는가?
엔지니어링 보고서와 직원용 자료 사례가 중요한 이유도 여기에 있습니다.
AI가 단순히 텍스트를 생성하는 단계에서 전체 워크플로우를 완료하는 단계로 이동하고 있다는 뜻입니다.
PDF, 보고서, 웹페이지, 영상 등 다양한 소스를 다루는 업무라면 iWeaver도 비슷한 워크플로우 중심 접근 방식을 제공합니다. 흩어진 정보를 요약, 구조화된 노트, 마인드맵, 재사용 가능한 지식으로 정리할 수 있습니다.
더 자유로운 브레인스토밍, 스토리텔링, 창작 대화를 원한다면 XPT는 보다 유연한 대화와 불필요한 중단이 적은 AI 경험에 초점을 맞추고 있습니다.
모델이 발전할수록 어떤 모델을 선택하느냐만큼 어떤 워크플로우를 선택하느냐도 중요해지고 있습니다.
Muse Spark 1.3을 사용해볼 만할까?
Muse Spark 1.3은 특히 다음 작업에서 흥미로운 선택이 될 수 있습니다.
- 소프트웨어 엔지니어링
- 장문 컨텍스트 리서치
- 복잡한 문서 작업
- AI 에이전트
- 자동화
- Computer Use
- 여러 도구를 사용하는 워크플로우
특히 장문 컨텍스트와 코딩 벤치마크 개선 폭이 큽니다.
하지만 실제로 더 중요한 변화는 화려하지 않은 부분일 수 있습니다.
불필요한 도구 호출 감소, 토큰 사용량 절감, 긴 지시사항 유지 능력 개선, 그리고 언제 사용자에게 도움을 요청해야 하는지를 판단하는 능력입니다.
이런 개선은 AI 에이전트를 더 신뢰할 수 있게 만들고 대규모 운영도 더 쉽게 해줍니다.
마무리
Muse Spark 1.3은 AI 모델 경쟁이 앞으로 어디로 향할지 잘 보여주는 사례입니다.
다음 세대 모델은 단 한 번의 답변이 얼마나 인상적인지만으로 평가되지 않을 것입니다.
앞으로는 다음 능력도 중요해집니다.
- 작업 목표를 계속 유지하는가
- 여러 파일을 함께 처리할 수 있는가
- 도구를 효율적으로 사용하는가
- 긴 지시사항을 기억하는가
- 자신의 실수를 인식하는가
- 마지막에 실제로 유용한 결과물을 전달하는가
Muse Spark 1.3은 이 모든 영역에서 분명한 발전을 보여줍니다.
모든 벤치마크에서 1위를 차지한 것은 아니며, Meta가 공개한 비교에서 사용한 Max Reasoning 설정도 아직 모든 사용자에게 기본 제공되는 환경은 아닙니다.
하지만 Muse Spark 1.2와 비교하면 방향은 분명합니다.
Meta는 Muse Spark를 단순히 성능 좋은 모델에서 실제 업무에 더 적합한 실용적인 AI 에이전트로 발전시키고 있습니다.
