Claude Sonnet 5.5 vs Meta Muse: Can MCP Turn Claude Into a Full AI Agent?
META BUILT MUSE.BUT CAN CLAUDE + MCP ALREADY DO IT?
Claude Sonnet 5.5 vs Meta Muse: Can MCP Turn Claude Into a Full AI Agent?
Sonnet 5.5 shipped today. Muse shipped three weeks ago. One is a model and the other is a finished product, so this post takes Muse apart and checks how much of it you can rebuild with Claude and the Model Context Protocol.
Quick facts
- Meta announced Muse on September 8, 2026. It runs on a model called Muse Spark and is rolling out in the US on iOS, Android, the web and WhatsApp.
- Muse has a free tier plus paid plans at $20 and $100 a month, according to Tech Insider.
- Anthropic released Claude Sonnet 5.5 on September 28, 2026 at $2 per million input tokens and $10 per million output tokens, the same price as Sonnet 5.
- Sonnet 5.5 scores 80.1% on OSWorld 2.1, a computer-use benchmark. Sonnet 5 scored 57%.
- MCP is an open protocol Anthropic introduced in November 2024 and donated to the Linux Foundation's Agentic AI Foundation in December 2025.
Is Muse a smarter AI, or a better-equipped one?
Meta built Muse as a full personal AI agent. But if Claude Sonnet 5.5 can already reason, use tools, browse, and connect to external applications through MCP, how much of Muse is actually new, and how much is great infrastructure wrapped around an AI model?
Muse can open a browser, fill out forms, send email, plan a trip, shop, and keep working after you close the app. Meta calls it a personal agent built for everyone. In the same month, Anthropic shipped Sonnet 5.5 and pitched it as a faster, cheaper work partner that needs fewer tool calls to finish a job.
Those launches answer different questions. Muse answers "what can an agent do for me today with zero setup?" Sonnet 5.5 answers "how good is the brain I plug into my own agent?" If you write software, the second question leads straight to a third one: if I connect Sonnet 5.5 to MCP servers for my mail, my calendar, my code and a browser, how close do I get to Muse?
I build web apps and AI integrations for clients, so I went through both launches piece by piece. Below, Muse gets split into its parts, each part gets matched to what Claude and MCP already give you, and everything left over goes on a build list.
What is Claude Sonnet 5.5, and what changed?
Claude Sonnet 5.5 is Anthropic's mid-size model, released on September 28, 2026 under the model ID claude-sonnet-5-5. It sits below Opus 5.5 in the lineup, but on most agent benchmarks it lands within a couple of points of it, at a lower price.
The launch was mostly about efficiency. Anthropic says Sonnet 5.5 writes output about 30% faster than Sonnet 5 and can cut the cost of a task by up to 30%, largely because it spends fewer tokens and makes fewer tool calls. Lovable reported roughly one third fewer tool calls in its builds. Box reported runs 2.4 times faster with 12% fewer tokens. The Decoder adds that the model batches tool calls better than its predecessor, which matters a lot once every call goes out over the network to an MCP server.
| Benchmark | Sonnet 5.5 | Opus 5.5 | Sonnet 5 |
|---|---|---|---|
| OSWorld 2.1 (computer use) | 80.1% | 81.8% | 57% |
| Terminal-Bench 4.0 (agentic terminal work) | 70.6% | 66.4% | 10.3% |
| GDPval-AA (knowledge work, Elo) | 1844 | 1846 | 1449 |
| CursorBench 4.0 (coding) | 55.5% | 57.8% | n/a |
Two more details matter if you want to build an agent on it. Sonnet 5.5 has adjustable effort levels, so a routine background check can run on low effort while a planning step runs on high. It is also available through the Claude API, AWS, Google Cloud and Microsoft Azure, which means it can live inside whatever cloud you already pay for.
What Sonnet 5.5 does not come with is your inbox. The model decides what to do and asks for a tool. Something else has to provide that tool, hold the login, and keep the loop running after the chat window closes.
What is Meta Muse, and how does it work?
Muse is Meta's consumer agent, announced on September 8, 2026 and powered by Muse Spark, which Meta describes as its most capable model for real-world agentic work. You can use it in the iOS and Android apps, on the web, and inside WhatsApp. AI glasses support is announced for later.
The model is one piece. Meta's announcement and early coverage describe a stack that ships together:
- A dedicated virtual machine per user, the Muse Secure VM, with its own browser and storage.
- A separate oversight agent called Sentinel that checks connector requests and outbound network calls against your settings, then allows them, blocks them, or asks you (as described by Edapt).
- Approval prompts before sensitive actions such as sending an email or making a purchase, and a complete audit trail of everything the agent did.
- Memory of your routines and of things you mentioned once, which Muse uses to suggest actions without being asked.
- Background execution. Muse keeps working after you close the app and comes back when it needs a decision.
- Payments through Stripe's Link at launch, with Shop Pay and 1Password support announced for later.
The browser deserves a closer look. According to Edapt, Muse reads a page's accessibility tree instead of its raw code, cannot run JavaScript inside pages, and pauses when you take control or when a saved credential is being filled in. It is a conservative design. The agent loses some flexibility on messy websites, and in return it becomes harder for a hostile page to steer.
Which parts of Muse are efficient?
Setup is where Muse saves the most time. You never write OAuth code, pick a database for memory, or host a browser. Approvals and the audit trail work from the first minute. Payments go through single-use card numbers that are tied to one merchant, capped at an amount and valid for a limited time, which removes a whole class of risk from a shopping agent. For someone who does not code, that bundle is the entire product.
The limits come from the same bundle. Coverage so far describes a narrower set of integrations than developer agent tools can reach, availability is US only for adults, and Edapt reports that beta testers saw disconnections and at least one agent that went beyond a narrow task. Conversations are also used to train future models by default unless you switch that off.
So what are we really comparing?
Most "Claude vs Muse" takes put a model next to a product. Written out, the comparison looks like this:
Claude Sonnet 5.5 = intelligence / model
Meta Muse = model + infrastructure + tools + runtime
Sonnet 5.5 competes with Muse Spark. Muse the product competes with an agent stack, and you can assemble one around Claude. The useful question is how much of that stack already exists as open parts. MCP is the biggest of those parts.
Can Claude + MCP do what Muse does?
The Model Context Protocol is an open standard for connecting AI applications to tools and data. An MCP server exposes tools (actions such as "create event"), resources (data such as a file) and prompts. An MCP client, which can be one of Claude's apps or an agent you write on the Claude API, connects to those servers and lets the model call them. For remote servers the spec defines an OAuth-based authorization flow, so the user signs in to the service and the agent receives a scoped token instead of a password.
Here is how Muse's feature list maps onto MCP:
| Muse can | Claude + MCP uses | What the agent gets |
|---|---|---|
| Send and read email | Gmail MCP server or connector | Search threads, draft, send with OAuth scopes |
| Manage your calendar | Google Calendar MCP server | Free slots, new events, updates |
| Work with files | Google Drive MCP server | Search, read and write docs and sheets |
| Code (not a Muse focus) | GitHub MCP server | Issues, pull requests, repo search |
| Browse and fill forms | Playwright MCP server or Claude in Chrome | Navigate, click, read and type in a real browser |
| Remember your data | Postgres, SQLite or Supabase MCP server | Rows the agent can query and update later |
| Work in the background | A queue or scheduler exposed as MCP tools | Enqueue a job, check its status later |
| Use other services | A small custom MCP server over any REST API | Your internal API as a handful of tools |
Wiring up local servers takes a few lines of config. This is the standard mcpServers format that Claude Desktop and many other clients read:
{
"mcpServers": {
"browser": { "command": "npx", "args": ["@playwright/mcp@latest"] },
"github": { "command": "docker",
"args": ["run", "-i", "--rm", "-e", "GITHUB_PERSONAL_ACCESS_TOKEN",
"ghcr.io/github/github-mcp-server"] },
"postgres": { "command": "npx",
"args": ["-y", "@modelcontextprotocol/server-postgres",
"postgresql://localhost/agent"] }
}
}
Gmail, Google Calendar and Drive are available as ready-made connectors in Claude's apps, and Anthropic already ships Claude in Chrome for browsing and scheduled tasks for recurring work. On raw capability, then, the answer is yes. A Claude agent with these servers can read your inbox, check your calendar, fill a web form and write to a database. The gap sits around those calls.
What would you still have to build?
Muse users never see this part, and Claude developers cannot skip it. Each item below is something Meta built once, for every user.
Permissions and approvals
MCP tells the client which tools exist. It does not decide which ones the agent may call without asking. You need a policy layer, your own version of Sentinel, that labels each tool as read, write or money-moving and pauses for a human on the last two.
OAuth and credential storage
The spec defines how a client obtains a token. Storing refresh tokens per user, encrypting them, rotating them and keeping them out of the model's context is still your job. Muse keeps passwords and card details where the agent itself cannot read them, and your stack should do the same.
Memory
A context window is not memory. For an agent that still knows your job preferences next week, you need a store (Postgres with embeddings is a common start), rules for what gets saved, and a page where the user can see and delete it.
Background jobs
A chat request ends when the reply ends. "Follow up in five days" needs a queue, a scheduler, workers that wake the agent with its saved state, and retries for when an API times out.
Audit logs
Every tool call, its input, its result and the person who approved it should land in an append-only log the user can read. That log is how you debug the agent and how you answer "why did it send that?"
Security against prompt injection
A browsing agent reads text written by strangers, and a job listing can hide instructions aimed at your agent. Treat page content as data, restrict which tools can run right after reading untrusted content, and keep money and messages behind approval. Muse's accessibility-tree reading and its no-JavaScript rule are Meta's answer to the same problem.
A browser environment
Playwright on your laptop is fine for testing. Real users need isolated browser sessions per person, servers to run them on, and a live view so the user can watch or take over. In other words, you rebuild the Muse Secure VM.
What does the full architecture look like?
Claude sits in the middle as the planner. The agent runtime runs the loop: it sends context to Claude, receives a tool call, checks it against the policy, routes it through the MCP client, logs it, and feeds the result back. MCP servers and direct APIs reach the outside world. Memory, a job queue with workers, and an isolated browser sit around the loop. The user only touches two screens: approvals and the log.
What does this look like on a real task?
Take a request that could run in a Muse ad: "Find remote React jobs posted this week, check my calendar for interview slots, prepare the applications, save my progress, and follow up in five days."
- Search. Claude plans queries and calls the Playwright MCP server to open job boards. Page text is tagged as untrusted. needs a browser environment and injection rules
- Filter. Listings are compared with your saved preferences, such as remote only and a minimum salary, loaded from memory. needs memory
- Check time. The Calendar server returns free slots for the next two weeks. ready with MCP
- Draft. Claude writes a tailored cover letter for each job and saves the drafts to Drive. ready with MCP
- Approve. The runtime shows you the shortlist and the drafts. Nothing goes out until you tap approve. needs permissions
- Submit and log. Approved applications go out through the browser or Gmail, and each action is written to the audit log and to a jobs table in Postgres. needs an audit log
- Follow up. A job scheduled for day five wakes the agent. It checks Gmail for replies and drafts polite follow-ups for the companies that stayed silent. needs background jobs
Look at which steps are marked ready. MCP and Sonnet 5.5 cover the thinking and the calls. The steps that still need work are the ones that make an agent safe to leave alone.
Where is Muse ahead, and where does Claude + MCP win?
| Area | Meta Muse | Claude Sonnet 5.5 + MCP |
|---|---|---|
| Setup | Sign in and start | You build and host the runtime |
| Integrations | Email, calendar, payments, shopping, Meta apps; a narrower list so far | Any service with an MCP server or an API |
| Browser | Managed VM browser, accessibility tree, no page JavaScript | Playwright or Claude in Chrome; you choose the isolation |
| Permissions | Sentinel: allow, deny or ask | You write the policy layer |
| Memory | Built in and proactive | You pick the store and the rules |
| Background work | Keeps going after the app closes | Your queue, scheduler and workers |
| Payments | Link with single-use cards | Your own payment integration |
| Model choice | Muse Spark only | Sonnet 5.5, Opus 5.5 or another model behind the same servers |
| Data control | Meta's policies, training on by default | Your servers and your retention rules |
| Price | Free, $20 or $100 a month | $2 / $10 per million tokens plus hosting |
Muse is the efficient choice for a person who wants results this week. Claude with MCP is the efficient choice for a team that needs an agent inside its own product, under its own data rules, connected to systems Meta will never integrate.
Is the real competition the model or the infrastructure?
The gap between models keeps shrinking. Sonnet 5.5 lands within two points of Opus 5.5 on OSWorld and GDPval at a lower price, and mid-size models from every lab improve every few months. A model release does not include a VM, a permission agent, a credential vault, a scheduler or an audit trail.
Meta built exactly those parts, and they are why Muse feels new even though each ability existed before. For developers, MCP turns most of the tool side into configuration. What remains is the runtime: the pieces that let an agent act while you are away and prove afterwards what it did.
My read is that the competition will increasingly be about the agent infrastructure around the model, not only the model itself. The open question is who owns that infrastructure. It could end up inside a few consumer apps, or it could be assembled from open parts like MCP by any developer who wants to. Which of the two would you trust with your inbox?
Frequently asked questions
Can Claude Sonnet 5.5 browse the web on its own?
It can control a browser once you give it a browser tool, for example the Playwright MCP server or Claude in Chrome. Its 80.1% score on OSWorld 2.1 measures this kind of computer use.
Is MCP only for Claude?
No. MCP is an open standard hosted by the Agentic AI Foundation under the Linux Foundation, and many AI clients and tools support it.
Does Claude keep working in the background like Muse?
Not through the API by default. You add background execution with a queue and workers, or you use scheduled tasks in Anthropic's apps where they are available.
How much does Meta Muse cost?
Muse has a free tier and paid plans at $20 and $100 a month, according to Tech Insider's launch coverage.
Is it safe to let an AI agent send email for me?
Only with an approval step. Muse asks before it sends email or buys anything. If you build with Claude and MCP, put the same approval gate in front of every write action.
References
- Meta Newsroom: Introducing Muse (Sept 8, 2026)
- Tech Insider: Meta Muse launch, pricing tiers
- Edapt: How Meta's personal AI agent works
- MindStudio: Meta Muse explained
- VentureBeat: Claude Sonnet 5.5 launch and benchmarks
- TechCrunch: Anthropic releases Sonnet 5.5
- The Decoder: Sonnet 5.5 nearly matches Opus 5.5
- MCP Blog: MCP joins the Agentic AI Foundation
- Model Context Protocol specification
- Playwright MCP server
- GitHub MCP server
میٹا نے Muse بنا لیا۔کیا Claude + MCP یہ کام پہلے ہی کر سکتے ہیں؟
Claude Sonnet 5.5 بمقابلہ Meta Muse: کیا MCP کلاڈ کو مکمل AI ایجنٹ بنا سکتا ہے؟
Sonnet 5.5 آج ریلیز ہوا اور Muse تین ہفتے پہلے آیا۔ ایک ماڈل ہے، دوسرا مکمل پروڈکٹ۔ اس تحریر میں Muse کو حصوں میں کھول کر دیکھا گیا ہے کہ اس کا کتنا حصہ Claude اور Model Context Protocol سے دوبارہ بنایا جا سکتا ہے۔
اہم حقائق
- میٹا نے 8 ستمبر 2026 کو Muse کا اعلان کیا۔ یہ Muse Spark نامی ماڈل پر چلتا ہے اور امریکہ میں iOS، Android، ویب اور WhatsApp پر آ رہا ہے۔
- Tech Insider کے مطابق Muse کا ایک مفت پلان ہے، اور 20 ڈالر اور 100 ڈالر ماہانہ کے پیڈ پلان ہیں۔
- Anthropic نے 28 ستمبر 2026 کو Claude Sonnet 5.5 جاری کیا۔ قیمت 2 ڈالر فی ملین ان پٹ ٹوکن اور 10 ڈالر فی ملین آؤٹ پٹ ٹوکن ہے، یعنی Sonnet 5 جتنی۔
- کمپیوٹر یوز بینچ مارک OSWorld 2.1 پر Sonnet 5.5 کا اسکور 80.1% ہے، جبکہ Sonnet 5 کا 57% تھا۔
- MCP ایک اوپن پروٹوکول ہے جو Anthropic نے نومبر 2024 میں متعارف کرایا اور دسمبر 2025 میں Linux Foundation کی Agentic AI Foundation کو دے دیا۔
کیا Muse زیادہ ذہین ہے، یا بس زیادہ لیس؟
میٹا نے Muse کو ایک مکمل ذاتی AI ایجنٹ کے طور پر بنایا۔ لیکن اگر Claude Sonnet 5.5 پہلے ہی سوچ سکتا ہے، ٹولز چلا سکتا ہے، ویب براؤز کر سکتا ہے اور MCP کے ذریعے بیرونی ایپس سے جڑ سکتا ہے، تو Muse میں واقعی نیا کتنا ہے، اور کتنا حصہ ایک AI ماڈل کے گرد بنایا گیا عمدہ انفراسٹرکچر ہے؟
Muse براؤزر کھول سکتا ہے، فارم بھر سکتا ہے، ای میل بھیج سکتا ہے، سفر پلان کر سکتا ہے، خریداری کر سکتا ہے، اور ایپ بند کرنے کے بعد بھی کام جاری رکھتا ہے۔ میٹا اسے سب کے لیے بنایا گیا ذاتی ایجنٹ کہتا ہے۔ اسی مہینے Anthropic نے Sonnet 5.5 جاری کیا اور اسے تیز اور سستا ورک پارٹنر بتایا جو کام مکمل کرنے کے لیے کم ٹول کالز کرتا ہے۔
یہ دونوں لانچ الگ سوالوں کا جواب ہیں۔ Muse بتاتا ہے کہ بغیر کسی سیٹ اپ کے آج ایک ایجنٹ میرے لیے کیا کر سکتا ہے۔ Sonnet 5.5 بتاتا ہے کہ میں اپنے ایجنٹ میں جو دماغ لگاؤں وہ کتنا اچھا ہے۔ اگر آپ سافٹ ویئر بناتے ہیں تو دوسرا سوال سیدھا تیسرے تک لے جاتا ہے: اگر میں Sonnet 5.5 کو ای میل، کیلنڈر، کوڈ اور براؤزر کے MCP سرورز سے جوڑ دوں تو میں Muse کے کتنا قریب پہنچوں گا؟
میں کلائنٹس کے لیے ویب ایپس اور AI انٹیگریشنز بناتا ہوں، اس لیے میں نے دونوں لانچز کو ٹکڑا ٹکڑا کر کے دیکھا۔ نیچے Muse کو حصوں میں بانٹا گیا ہے، ہر حصے کو Claude اور MCP کی موجودہ صلاحیت سے ملایا گیا ہے، اور جو باقی بچا وہ بنانے کی فہرست میں ڈال دیا گیا ہے۔
Claude Sonnet 5.5 کیا ہے، اور اس میں کیا بدلا؟
Claude Sonnet 5.5 اینتھروپک کا درمیانے سائز کا ماڈل ہے جو 28 ستمبر 2026 کو ماڈل آئی ڈی claude-sonnet-5-5 کے ساتھ جاری ہوا۔ لائن اپ میں یہ Opus 5.5 سے نیچے ہے، مگر زیادہ تر ایجنٹ بینچ مارکس پر اس کے چند پوائنٹس کے اندر رہتا ہے اور سستا بھی ہے۔
اس لانچ کا مرکز رفتار اور کفایت تھی۔ Anthropic کے مطابق Sonnet 5.5، Sonnet 5 سے تقریباً 30% تیز آؤٹ پٹ دیتا ہے اور کسی کام کی لاگت 30% تک کم کر سکتا ہے، زیادہ تر اس لیے کہ یہ کم ٹوکن اور کم ٹول کالز خرچ کرتا ہے۔ Lovable نے بتایا کہ اس کی بلڈز میں ٹول کالز تقریباً ایک تہائی کم ہوئیں۔ Box کے مطابق کام 2.4 گنا تیز ہوا اور ٹوکن 12% کم لگے۔ The Decoder لکھتا ہے کہ یہ ماڈل پچھلے ماڈل سے بہتر طریقے سے ٹول کالز کو اکٹھا بھیجتا ہے، اور جب ہر کال نیٹ ورک پر MCP سرور تک جاتی ہو تو یہ بات بہت اہم ہو جاتی ہے۔
| بینچ مارک | Sonnet 5.5 | Opus 5.5 | Sonnet 5 |
|---|---|---|---|
| OSWorld 2.1 (کمپیوٹر یوز) | 80.1% | 81.8% | 57% |
| Terminal-Bench 4.0 (ٹرمینل پر ایجنٹ کا کام) | 70.6% | 66.4% | 10.3% |
| GDPval-AA (نالج ورک، Elo) | 1844 | 1846 | 1449 |
| CursorBench 4.0 (کوڈنگ) | 55.5% | 57.8% | دستیاب نہیں |
ایجنٹ بنانے والوں کے لیے دو باتیں اور اہم ہیں۔ Sonnet 5.5 میں effort کی سطح بدلی جا سکتی ہے، یعنی معمول کا بیک گراؤنڈ چیک کم effort پر اور منصوبہ بندی والا مرحلہ زیادہ effort پر چلایا جا سکتا ہے۔ یہ Claude API، AWS، Google Cloud اور Microsoft Azure پر بھی دستیاب ہے، اس لیے آپ جس کلاؤڈ پر پہلے سے ہیں وہیں اسے رکھ سکتے ہیں۔
Sonnet 5.5 کے ساتھ آپ کا ان باکس نہیں آتا۔ ماڈل فیصلہ کرتا ہے کہ کیا کرنا ہے اور ٹول مانگتا ہے۔ وہ ٹول فراہم کرنا، لاگ اِن سنبھالنا، اور چیٹ بند ہونے کے بعد لوپ چلائے رکھنا کسی اور حصے کا کام ہے۔
Meta Muse کیا ہے، اور یہ کیسے کام کرتا ہے؟
Muse میٹا کا عام صارفین کے لیے ایجنٹ ہے جس کا اعلان 8 ستمبر 2026 کو ہوا۔ یہ Muse Spark پر چلتا ہے، جسے میٹا حقیقی دنیا کے ایجنٹک کام کے لیے اپنا سب سے قابل ماڈل کہتا ہے۔ یہ iOS اور Android ایپس، ویب اور WhatsApp کے اندر دستیاب ہے، اور AI گلاسز کی سپورٹ بعد میں آنے کا اعلان ہے۔
ماڈل صرف ایک حصہ ہے۔ میٹا کے اعلان اور ابتدائی رپورٹس کے مطابق یہ حصے ایک ساتھ آتے ہیں:
- ہر صارف کے لیے الگ ورچوئل مشین، جسے Muse Secure VM کہا جاتا ہے، جس کا اپنا براؤزر اور اسٹوریج ہے۔
- Sentinel نام کا الگ نگران ایجنٹ جو کنیکٹر کی درخواستوں اور باہر جانے والی نیٹ ورک کالز کو آپ کی سیٹنگز سے ملاتا ہے، پھر اجازت دیتا ہے، روکتا ہے یا آپ سے پوچھتا ہے (Edapt کی رپورٹ کے مطابق)۔
- ای میل بھیجنے یا خریداری جیسے حساس کاموں سے پہلے منظوری کا پیغام، اور ایجنٹ کے ہر کام کا مکمل آڈٹ ٹریل۔
- آپ کے معمولات اور ایک بار کہی گئی باتوں کی یادداشت، جس کی مدد سے Muse بغیر پوچھے کام تجویز کرتا ہے۔
- بیک گراؤنڈ میں کام۔ ایپ بند کرنے کے بعد بھی Muse چلتا رہتا ہے اور فیصلے کی ضرورت پر واپس آتا ہے۔
- لانچ پر Stripe کے Link سے ادائیگی، جبکہ Shop Pay اور 1Password کی سپورٹ بعد میں آنے کا اعلان ہے۔
براؤزر والا حصہ غور سے دیکھنے کے قابل ہے۔ Edapt کے مطابق Muse صفحے کا خام کوڈ پڑھنے کے بجائے اس کا accessibility tree پڑھتا ہے، صفحات کے اندر JavaScript نہیں چلا سکتا، اور جب آپ کنٹرول سنبھالیں یا محفوظ پاس ورڈ بھرا جا رہا ہو تو رک جاتا ہے۔ یہ محتاط ڈیزائن ہے۔ بے ترتیب ویب سائٹس پر ایجنٹ کی لچک کچھ کم ہوتی ہے، مگر بدنیت صفحے کے لیے اسے گمراہ کرنا مشکل ہو جاتا ہے۔
Muse کے کون سے حصے سب سے مؤثر ہیں؟
سب سے زیادہ وقت سیٹ اپ میں بچتا ہے۔ آپ کو OAuth کوڈ لکھنا، یادداشت کے لیے ڈیٹابیس چننا یا براؤزر ہوسٹ کرنا نہیں پڑتا۔ منظوریاں اور آڈٹ ٹریل پہلے منٹ سے کام کرتے ہیں۔ ادائیگی ایک بار استعمال ہونے والے کارڈ نمبرز سے ہوتی ہے جو ایک دکان، ایک حد اور محدود وقت تک بندھے ہوتے ہیں، جس سے شاپنگ ایجنٹ کا ایک پورا خطرہ ختم ہو جاتا ہے۔ جو شخص کوڈ نہیں لکھتا اس کے لیے یہی پیکج پوری پروڈکٹ ہے۔
حدود بھی اسی پیکج سے آتی ہیں۔ اب تک کی رپورٹس کے مطابق انٹیگریشنز ڈیولپر ایجنٹ ٹولز سے کم ہیں، سروس صرف امریکہ میں بالغوں کے لیے ہے، اور Edapt کے مطابق بیٹا ٹیسٹرز نے کنکشن ٹوٹنے اور کم از کم ایک ایسے ایجنٹ کی شکایت کی جو محدود کام سے آگے نکل گیا۔ گفتگو بطور ڈیفالٹ آئندہ ماڈلز کی تربیت میں استعمال ہوتی ہے، جب تک آپ اسے بند نہ کریں۔
تو اصل میں موازنہ کس چیز کا ہے؟
زیادہ تر "Claude بمقابلہ Muse" تبصرے ایک ماڈل کو ایک پروڈکٹ کے ساتھ کھڑا کر دیتے ہیں۔ لکھ کر دیکھیں تو موازنہ یوں بنتا ہے:
Claude Sonnet 5.5 = ذہانت / ماڈل
Meta Muse = ماڈل + انفراسٹرکچر + ٹولز + رن ٹائم
Sonnet 5.5 کا مقابلہ Muse Spark سے ہے۔ Muse بطور پروڈکٹ ایک ایجنٹ اسٹیک کا مقابلہ کرتا ہے، اور ایسا اسٹیک Claude کے گرد بنایا جا سکتا ہے۔ کام کا سوال یہ ہے کہ اس اسٹیک کا کتنا حصہ اوپن پرزوں کی شکل میں پہلے سے موجود ہے۔ ان میں سب سے بڑا پرزہ MCP ہے۔
کیا Claude + MCP وہ سب کر سکتے ہیں جو Muse کرتا ہے؟
Model Context Protocol ایک اوپن اسٹینڈرڈ ہے جو AI ایپس کو ٹولز اور ڈیٹا سے جوڑتا ہے۔ MCP سرور ٹولز (جیسے "ایونٹ بناؤ")، ریسورسز (جیسے کوئی فائل) اور پرامپٹس فراہم کرتا ہے۔ MCP کلائنٹ، چاہے وہ Claude کی کوئی ایپ ہو یا Claude API پر آپ کا لکھا ایجنٹ، ان سرورز سے جڑتا ہے اور ماڈل کو انہیں استعمال کرنے دیتا ہے۔ ریموٹ سرورز کے لیے اسپیسیفکیشن OAuth پر مبنی اجازت کا طریقہ طے کرتی ہے، یعنی صارف سروس میں خود سائن اِن کرتا ہے اور ایجنٹ کو پاس ورڈ کے بجائے محدود ٹوکن ملتا ہے۔
Muse کی خصوصیات MCP پر یوں بیٹھتی ہیں:
| Muse کیا کرتا ہے | Claude + MCP کیا استعمال کرتا ہے | ایجنٹ کو کیا ملتا ہے |
|---|---|---|
| ای میل بھیجنا اور پڑھنا | Gmail MCP سرور یا کنیکٹر | تھریڈ تلاش، ڈرافٹ، OAuth اسکوپ کے ساتھ بھیجنا |
| کیلنڈر سنبھالنا | Google Calendar MCP سرور | خالی وقت، نئے ایونٹس، تبدیلیاں |
| فائلوں پر کام | Google Drive MCP سرور | ڈاکس اور شیٹس کی تلاش، پڑھنا، لکھنا |
| کوڈ (Muse کا فوکس نہیں) | GitHub MCP سرور | ایشوز، پل ریکوئسٹس، ریپو سرچ |
| براؤز کرنا اور فارم بھرنا | Playwright MCP سرور یا Claude in Chrome | اصلی براؤزر میں جانا، کلک، پڑھنا، لکھنا |
| آپ کا ڈیٹا یاد رکھنا | Postgres، SQLite یا Supabase MCP سرور | ریکارڈز جنہیں ایجنٹ بعد میں پڑھ اور بدل سکے |
| بیک گراؤنڈ میں کام | MCP ٹولز کی شکل میں قطار یا شیڈیولر | جاب قطار میں ڈالنا، بعد میں اسٹیٹس دیکھنا |
| دوسری سروسز | کسی بھی REST API پر چھوٹا کسٹم MCP سرور | آپ کی اندرونی API چند ٹولز کی شکل میں |
لوکل سرورز جوڑنے کے لیے چند لائنوں کی کنفیگ کافی ہے۔ یہ وہی معیاری mcpServers فارمیٹ ہے جو Claude Desktop اور کئی دوسرے کلائنٹس پڑھتے ہیں:
{
"mcpServers": {
"browser": { "command": "npx", "args": ["@playwright/mcp@latest"] },
"github": { "command": "docker",
"args": ["run", "-i", "--rm", "-e", "GITHUB_PERSONAL_ACCESS_TOKEN",
"ghcr.io/github/github-mcp-server"] },
"postgres": { "command": "npx",
"args": ["-y", "@modelcontextprotocol/server-postgres",
"postgresql://localhost/agent"] }
}
}
Gmail، Google Calendar اور Drive کلاڈ کی ایپس میں تیار کنیکٹرز کے طور پر موجود ہیں، اور Anthropic براؤزنگ کے لیے Claude in Chrome اور بار بار ہونے والے کام کے لیے scheduled tasks پہلے ہی دیتا ہے۔ یعنی خالص صلاحیت کی بات کریں تو جواب ہاں ہے۔ ان سرورز والا Claude ایجنٹ آپ کا ان باکس پڑھ سکتا ہے، کیلنڈر دیکھ سکتا ہے، ویب فارم بھر سکتا ہے اور ڈیٹابیس میں لکھ سکتا ہے۔ کمی ان کالز کے اردگرد ہے۔
پھر آپ کو خود کیا بنانا پڑے گا؟
Muse کے صارفین یہ حصہ کبھی نہیں دیکھتے، اور Claude پر کام کرنے والے ڈیولپر اسے چھوڑ نہیں سکتے۔ نیچے ہر چیز وہ ہے جو میٹا نے ایک بار، سب صارفین کے لیے بنائی۔
اجازتیں اور منظوریاں
MCP کلائنٹ کو بتاتا ہے کہ کون سے ٹولز موجود ہیں۔ یہ فیصلہ نہیں کرتا کہ ایجنٹ کون سا ٹول بغیر پوچھے چلا سکتا ہے۔ اس کے لیے پالیسی کی تہہ چاہیے، یعنی آپ کا اپنا Sentinel، جو ہر ٹول کو پڑھنے، لکھنے یا پیسے بھیجنے والا قرار دے اور آخری دو پر انسان کا انتظار کرے۔
OAuth اور لاگ اِن کا محفوظ ذخیرہ
اسپیسیفکیشن بتاتی ہے کہ کلائنٹ ٹوکن کیسے حاصل کرے۔ ہر صارف کے refresh ٹوکن محفوظ کرنا، انہیں انکرپٹ کرنا، بدلتے رہنا اور ماڈل کے کانٹیکسٹ سے دور رکھنا پھر بھی آپ کی ذمہ داری ہے۔ Muse پاس ورڈز اور کارڈ کی تفصیل وہاں رکھتا ہے جہاں ایجنٹ خود انہیں نہیں پڑھ سکتا، اور آپ کے اسٹیک کو بھی یہی کرنا چاہیے۔
یادداشت
کانٹیکسٹ ونڈو یادداشت نہیں ہے۔ اگر ایجنٹ کو اگلے ہفتے بھی آپ کی نوکری کی ترجیحات یاد رکھنی ہیں تو ایک اسٹور چاہیے (عام آغاز Postgres اور embeddings سے ہوتا ہے)، یہ اصول کہ کیا محفوظ ہو، اور ایک صفحہ جہاں صارف اسے دیکھ اور مٹا سکے۔
بیک گراؤنڈ جابز
چیٹ کی درخواست جواب کے ساتھ ختم ہو جاتی ہے۔ "پانچ دن بعد فالو اپ کرنا" کے لیے قطار، شیڈیولر، ایسے ورکرز جو محفوظ حالت کے ساتھ ایجنٹ کو جگائیں، اور API ٹائم آؤٹ ہونے پر دوبارہ کوشش کا نظام چاہیے۔
آڈٹ لاگ
ہر ٹول کال، اس کا ان پٹ، نتیجہ اور منظوری دینے والے کا نام ایک ایسے لاگ میں جانا چاہیے جس میں صرف اضافہ ہو سکے اور جسے صارف پڑھ سکے۔ اسی سے آپ ایجنٹ کو ڈی بگ کرتے ہیں اور اسی سے اس سوال کا جواب دیتے ہیں کہ "اس نے یہ کیوں بھیجا؟"
پرامپٹ انجیکشن سے حفاظت
براؤز کرنے والا ایجنٹ اجنبیوں کا لکھا متن پڑھتا ہے، اور نوکری کے کسی اشتہار میں آپ کے ایجنٹ کے لیے چھپی ہدایات ہو سکتی ہیں۔ صفحے کے متن کو صرف ڈیٹا سمجھیں، غیر معتبر متن پڑھنے کے فوراً بعد چلنے والے ٹولز محدود کریں، اور پیسے اور پیغامات کو منظوری کے پیچھے رکھیں۔ Muse کا accessibility tree پڑھنا اور JavaScript نہ چلانے کا اصول اسی مسئلے کا میٹا والا حل ہے۔
براؤزر کا ماحول
ٹیسٹنگ کے لیے لیپ ٹاپ پر Playwright کافی ہے۔ اصل صارفین کے لیے ہر شخص کا الگ براؤزر سیشن، انہیں چلانے کے لیے سرورز، اور ایک لائیو ویو چاہیے تاکہ صارف دیکھ سکے یا کنٹرول لے سکے۔ سیدھی بات یہ کہ آپ Muse Secure VM دوبارہ بنا رہے ہیں۔
پورا آرکیٹیکچر کیسا دکھتا ہے؟
Claude درمیان میں منصوبہ ساز کے طور پر بیٹھا ہے۔ ایجنٹ رن ٹائم لوپ چلاتا ہے: Claude کو کانٹیکسٹ بھیجتا ہے، ٹول کال وصول کرتا ہے، اسے پالیسی سے جانچتا ہے، MCP کلائنٹ کے ذریعے آگے بھیجتا ہے، لاگ کرتا ہے اور نتیجہ واپس دیتا ہے۔ MCP سرورز اور براہ راست APIs باہر کی دنیا تک پہنچتے ہیں۔ یادداشت، ورکرز والی جاب قطار اور الگ براؤزر لوپ کے اردگرد ہیں۔ صارف صرف دو اسکرینز دیکھتا ہے: منظوریاں اور لاگ۔
ایک حقیقی کام پر یہ کیسا لگتا ہے؟
ایک ایسی درخواست لیں جو Muse کے اشتہار میں چل سکتی ہو: "اس ہفتے کی ریموٹ React نوکریاں ڈھونڈو، انٹرویو کے لیے میرا کیلنڈر دیکھو، درخواستیں تیار کرو، میری پیش رفت محفوظ کرو، اور پانچ دن بعد فالو اپ کرو۔"
- تلاش۔ Claude سرچ کا منصوبہ بناتا ہے اور جاب بورڈز کھولنے کے لیے Playwright MCP سرور کو کال کرتا ہے۔ صفحے کا متن غیر معتبر قرار دیا جاتا ہے۔ براؤزر ماحول اور انجیکشن اصول چاہیے
- چھانٹی۔ اشتہارات کو یادداشت میں محفوظ آپ کی ترجیحات سے ملایا جاتا ہے، جیسے صرف ریموٹ اور کم از کم تنخواہ۔ یادداشت چاہیے
- وقت دیکھنا۔ Calendar سرور اگلے دو ہفتوں کے خالی اوقات دیتا ہے۔ MCP سے تیار
- ڈرافٹ۔ Claude ہر نوکری کے لیے الگ کور لیٹر لکھ کر Drive میں محفوظ کرتا ہے۔ MCP سے تیار
- منظوری۔ رن ٹائم آپ کو فہرست اور ڈرافٹس دکھاتا ہے۔ آپ کے approve دبانے تک کچھ نہیں جاتا۔ اجازتیں چاہیئں
- جمع اور لاگ۔ منظور شدہ درخواستیں براؤزر یا Gmail سے جاتی ہیں، اور ہر عمل آڈٹ لاگ اور Postgres کی jobs ٹیبل میں لکھا جاتا ہے۔ آڈٹ لاگ چاہیے
- فالو اپ۔ پانچویں دن کی شیڈیول شدہ جاب ایجنٹ کو جگاتی ہے۔ وہ Gmail میں جواب دیکھتا ہے اور خاموش کمپنیوں کے لیے شائستہ فالو اپ ڈرافٹ کرتا ہے۔ بیک گراؤنڈ جابز چاہیئں
دیکھیں کون سے مراحل تیار ہیں۔ MCP اور Sonnet 5.5 سوچنے اور کالز کا کام سنبھال لیتے ہیں۔ جن مراحل پر کام باقی ہے وہی ایجنٹ کو اکیلا چھوڑنے کے قابل بناتے ہیں۔
Muse کہاں آگے ہے، اور Claude + MCP کہاں جیتتا ہے؟
| شعبہ | Meta Muse | Claude Sonnet 5.5 + MCP |
|---|---|---|
| سیٹ اپ | سائن اِن کریں اور شروع | رن ٹائم آپ بناتے اور ہوسٹ کرتے ہیں |
| انٹیگریشنز | ای میل، کیلنڈر، ادائیگی، شاپنگ، میٹا ایپس؛ فی الحال محدود فہرست | ہر وہ سروس جس کا MCP سرور یا API ہو |
| براؤزر | منیجڈ VM براؤزر، accessibility tree، صفحے پر JavaScript نہیں | Playwright یا Claude in Chrome؛ علیحدگی آپ طے کرتے ہیں |
| اجازتیں | Sentinel: اجازت، انکار یا سوال | پالیسی کی تہہ آپ لکھتے ہیں |
| یادداشت | پہلے سے موجود اور خود تجویز دیتی ہے | اسٹور اور اصول آپ چنتے ہیں |
| بیک گراؤنڈ کام | ایپ بند ہونے کے بعد بھی جاری | آپ کی قطار، شیڈیولر اور ورکرز |
| ادائیگی | Link اور ایک بار کے کارڈز | آپ کی اپنی پیمنٹ انٹیگریشن |
| ماڈل کا انتخاب | صرف Muse Spark | Sonnet 5.5، Opus 5.5 یا کوئی اور ماڈل، وہی سرورز |
| ڈیٹا کنٹرول | میٹا کی پالیسیاں، تربیت بطور ڈیفالٹ آن | آپ کے سرورز اور آپ کے اصول |
| قیمت | مفت، 20 ڈالر یا 100 ڈالر ماہانہ | 2 / 10 ڈالر فی ملین ٹوکن، ساتھ ہوسٹنگ |
جو شخص اسی ہفتے نتیجہ چاہتا ہے اس کے لیے Muse زیادہ مؤثر ہے۔ جس ٹیم کو اپنی پروڈکٹ کے اندر، اپنے ڈیٹا کے اصولوں کے ساتھ، اور ایسے سسٹمز سے جڑا ایجنٹ چاہیے جنہیں میٹا کبھی نہیں جوڑے گا، اس کے لیے Claude اور MCP بہتر ہیں۔
اصل مقابلہ ماڈل کا ہے یا انفراسٹرکچر کا؟
ماڈلز کا فرق کم ہوتا جا رہا ہے۔ Sonnet 5.5، OSWorld اور GDPval پر Opus 5.5 سے دو پوائنٹس کے اندر ہے اور سستا ہے، اور ہر لیب کے درمیانے ماڈل چند مہینوں میں بہتر ہو جاتے ہیں۔ ماڈل کی ریلیز کے ساتھ VM، اجازت دینے والا ایجنٹ، پاس ورڈز کا خانہ، شیڈیولر یا آڈٹ ٹریل نہیں آتے۔
میٹا نے یہی حصے بنائے، اور اسی لیے Muse نیا لگتا ہے حالانکہ ہر صلاحیت پہلے بھی موجود تھی۔ ڈیولپرز کے لیے MCP ٹولز والے زیادہ تر کام کو کنفیگریشن بنا دیتا ہے۔ باقی رن ٹائم بچتا ہے: وہ حصے جو آپ کی غیر موجودگی میں ایجنٹ کو کام کرنے دیتے ہیں اور بعد میں ثابت کرتے ہیں کہ اس نے کیا کیا۔
میری رائے میں مقابلہ زیادہ سے زیادہ ماڈل کے گرد ایجنٹ انفراسٹرکچر کا ہوتا جائے گا، صرف ماڈل کا نہیں۔ کھلا سوال یہ ہے کہ اس انفراسٹرکچر کا مالک کون ہوگا۔ یہ چند صارف ایپس کے اندر بند ہو سکتا ہے، یا MCP جیسے اوپن پرزوں سے کوئی بھی ڈیولپر اسے جوڑ سکتا ہے۔ آپ اپنے ان باکس کے لیے کس پر بھروسہ کریں گے؟
اکثر پوچھے جانے والے سوالات
کیا Claude Sonnet 5.5 خود ویب براؤز کر سکتا ہے؟
جب آپ اسے براؤزر ٹول دیں، مثلاً Playwright MCP سرور یا Claude in Chrome، تو یہ براؤزر چلا سکتا ہے۔ OSWorld 2.1 پر اس کا 80.1% اسکور اسی طرح کے کمپیوٹر یوز کو ناپتا ہے۔
کیا MCP صرف Claude کے لیے ہے؟
نہیں۔ MCP ایک اوپن اسٹینڈرڈ ہے جو Linux Foundation کی Agentic AI Foundation کے تحت ہے، اور بہت سے AI کلائنٹس اور ٹولز اسے سپورٹ کرتے ہیں۔
کیا Claude بھی Muse کی طرح بیک گراؤنڈ میں کام کرتا رہتا ہے؟
API کے ذریعے بطور ڈیفالٹ نہیں۔ بیک گراؤنڈ کام کے لیے قطار اور ورکرز شامل کرنے پڑتے ہیں، یا جہاں دستیاب ہوں وہاں Anthropic کی ایپس کے scheduled tasks استعمال کیے جا سکتے ہیں۔
Meta Muse کی قیمت کیا ہے؟
Tech Insider کی لانچ رپورٹ کے مطابق Muse کا مفت پلان ہے، اور 20 ڈالر اور 100 ڈالر ماہانہ کے پیڈ پلان ہیں۔
کیا AI ایجنٹ کو اپنی طرف سے ای میل بھیجنے دینا محفوظ ہے؟
صرف منظوری کے مرحلے کے ساتھ۔ Muse ای میل بھیجنے یا کچھ خریدنے سے پہلے پوچھتا ہے۔ اگر آپ Claude اور MCP سے بناتے ہیں تو ہر لکھنے والے عمل کے آگے یہی منظوری رکھیں۔
حوالہ جات
- Meta Newsroom: Introducing Muse (Sept 8, 2026)
- Tech Insider: Meta Muse launch, pricing tiers
- Edapt: How Meta's personal AI agent works
- MindStudio: Meta Muse explained
- VentureBeat: Claude Sonnet 5.5 launch and benchmarks
- TechCrunch: Anthropic releases Sonnet 5.5
- The Decoder: Sonnet 5.5 nearly matches Opus 5.5
- MCP Blog: MCP joins the Agentic AI Foundation
- Model Context Protocol specification
- Playwright MCP server
- GitHub MCP server
META CREÓ MUSE.¿PUEDEN CLAUDE + MCP HACERLO YA?
Claude Sonnet 5.5 vs Meta Muse: ¿puede MCP convertir a Claude en un agente de IA completo?
Sonnet 5.5 salió hoy. Muse salió hace tres semanas. Uno es un modelo y el otro un producto terminado, así que aquí desarmo Muse pieza por pieza y compruebo cuánto se puede reconstruir con Claude y el Model Context Protocol.
Datos clave
- Meta anunció Muse el 8 de septiembre de 2026. Funciona con un modelo llamado Muse Spark y se está desplegando en EE. UU. en iOS, Android, la web y WhatsApp.
- Muse tiene un plan gratuito y planes de pago de 20 y 100 dólares al mes, según Tech Insider.
- Anthropic lanzó Claude Sonnet 5.5 el 28 de septiembre de 2026 a 2 dólares por millón de tokens de entrada y 10 dólares por millón de salida, el mismo precio que Sonnet 5.
- Sonnet 5.5 obtiene un 80,1% en OSWorld 2.1, una prueba de uso de ordenador. Sonnet 5 obtuvo un 57%.
- MCP es un protocolo abierto que Anthropic presentó en noviembre de 2024 y donó a la Agentic AI Foundation de la Linux Foundation en diciembre de 2025.
¿Muse es una IA más lista o una IA mejor equipada?
Meta creó Muse como un agente personal de IA completo. Pero si Claude Sonnet 5.5 ya puede razonar, usar herramientas, navegar y conectarse a aplicaciones externas mediante MCP, ¿cuánto de Muse es realmente nuevo y cuánto es una gran infraestructura alrededor de un modelo de IA?
Muse abre un navegador, rellena formularios, envía correos, planifica viajes, compra y sigue trabajando después de que cierras la app. Meta lo presenta como un agente personal para todo el mundo. Ese mismo mes, Anthropic lanzó Sonnet 5.5 y lo describió como un compañero de trabajo más rápido y barato que necesita menos llamadas a herramientas para terminar una tarea.
Los dos lanzamientos responden preguntas distintas. Muse responde "¿qué puede hacer un agente por mí hoy sin configurar nada?". Sonnet 5.5 responde "¿qué tan bueno es el cerebro que conecto a mi propio agente?". Si programas, la segunda pregunta lleva directo a una tercera: si conecto Sonnet 5.5 a servidores MCP para mi correo, mi calendario, mi código y un navegador, ¿cuánto me acerco a Muse?
Desarrollo aplicaciones web e integraciones de IA para clientes, así que revisé ambos lanzamientos con calma. Abajo separo Muse en sus partes, emparejo cada parte con lo que Claude y MCP ya ofrecen, y dejo lo que falta en una lista de cosas por construir.
¿Qué es Claude Sonnet 5.5 y qué cambió?
Claude Sonnet 5.5 es el modelo de tamaño medio de Anthropic, lanzado el 28 de septiembre de 2026 con el ID claude-sonnet-5-5. Está por debajo de Opus 5.5 en la gama, pero en la mayoría de pruebas de agentes queda a un par de puntos de él y cuesta menos.
El lanzamiento giró en torno a la eficiencia. Anthropic dice que Sonnet 5.5 genera texto un 30% más rápido que Sonnet 5 y puede reducir el coste de una tarea hasta un 30%, sobre todo porque gasta menos tokens y hace menos llamadas a herramientas. Lovable reportó cerca de un tercio menos de llamadas en sus builds. Box reportó ejecuciones 2,4 veces más rápidas con un 12% menos de tokens. The Decoder añade que el modelo agrupa mejor las llamadas a herramientas, algo que importa mucho cuando cada llamada viaja por la red hasta un servidor MCP.
| Prueba | Sonnet 5.5 | Opus 5.5 | Sonnet 5 |
|---|---|---|---|
| OSWorld 2.1 (uso de ordenador) | 80,1% | 81,8% | 57% |
| Terminal-Bench 4.0 (trabajo en terminal) | 70,6% | 66,4% | 10,3% |
| GDPval-AA (trabajo de conocimiento, Elo) | 1844 | 1846 | 1449 |
| CursorBench 4.0 (programación) | 55,5% | 57,8% | s/d |
Hay dos detalles más que importan si quieres montar un agente encima. Sonnet 5.5 tiene niveles de esfuerzo ajustables, así que una revisión rutinaria en segundo plano puede ir en esfuerzo bajo y un paso de planificación en esfuerzo alto. Además está disponible en la API de Claude, AWS, Google Cloud y Microsoft Azure, de modo que puede vivir en la nube que ya pagas.
Lo que Sonnet 5.5 no trae es tu bandeja de entrada. El modelo decide qué hacer y pide una herramienta. Otra pieza tiene que darle esa herramienta, guardar el inicio de sesión y mantener el bucle vivo cuando se cierra el chat.
¿Qué es Meta Muse y cómo funciona?
Muse es el agente de consumo de Meta, anunciado el 8 de septiembre de 2026 y basado en Muse Spark, que Meta describe como su modelo más capaz para trabajo agéntico en el mundo real. Se usa en las apps de iOS y Android, en la web y dentro de WhatsApp. El soporte para gafas con IA está anunciado para más adelante.
El modelo es solo una pieza. El anuncio de Meta y la cobertura inicial describen un conjunto que se entrega junto:
- Una máquina virtual dedicada por usuario, la Muse Secure VM, con su propio navegador y almacenamiento.
- Un agente supervisor aparte llamado Sentinel que revisa las peticiones a conectores y las llamadas de red salientes según tu configuración, y las permite, las bloquea o te pregunta (según Edapt).
- Avisos de aprobación antes de acciones sensibles como enviar un correo o comprar algo, y un registro completo de todo lo que hizo el agente.
- Memoria de tus rutinas y de cosas que mencionaste una sola vez, que Muse usa para sugerir acciones sin que se lo pidas.
- Ejecución en segundo plano. Muse sigue trabajando al cerrar la app y vuelve cuando necesita una decisión.
- Pagos con Link de Stripe desde el lanzamiento, con Shop Pay y 1Password anunciados para después.
El navegador merece una mirada más atenta. Según Edapt, Muse lee el árbol de accesibilidad de la página en lugar del código, no puede ejecutar JavaScript dentro de las páginas y se detiene cuando tomas el control o cuando se rellena una credencial guardada. Es un diseño prudente. El agente pierde algo de flexibilidad en webs desordenadas y, a cambio, a una página maliciosa le cuesta más manipularlo.
¿Qué partes de Muse son más eficientes?
Donde más tiempo ahorra Muse es en la configuración. No escribes código OAuth, no eliges base de datos para la memoria y no alojas un navegador. Las aprobaciones y el registro funcionan desde el primer minuto. Los pagos usan números de tarjeta de un solo uso, atados a un comercio, con un importe máximo y válidos por poco tiempo, lo que elimina toda una categoría de riesgo en un agente de compras. Para quien no programa, ese paquete es el producto entero.
Los límites salen del mismo paquete. La cobertura habla de menos integraciones de las que alcanzan las herramientas para desarrolladores, solo está en EE. UU. para adultos y, según Edapt, algunos probadores beta vieron desconexiones y al menos un agente que se pasó de una tarea acotada. Además, las conversaciones se usan por defecto para entrenar futuros modelos, salvo que lo desactives.
Entonces, ¿qué estamos comparando de verdad?
Casi todas las comparaciones "Claude vs Muse" ponen un modelo al lado de un producto. Escrito, queda así:
Claude Sonnet 5.5 = inteligencia / modelo
Meta Muse = modelo + infraestructura + herramientas + runtime
Sonnet 5.5 compite con Muse Spark. Muse como producto compite con un stack de agente, y ese stack se puede montar alrededor de Claude. La pregunta útil es cuánto de ese stack ya existe como piezas abiertas. MCP es la más grande.
¿Pueden Claude + MCP hacer lo que hace Muse?
El Model Context Protocol es un estándar abierto para conectar aplicaciones de IA con herramientas y datos. Un servidor MCP expone herramientas (acciones como "crear evento"), recursos (datos como un archivo) y prompts. Un cliente MCP, que puede ser una app de Claude o un agente tuyo sobre la API de Claude, se conecta a esos servidores y deja que el modelo los llame. Para servidores remotos, la especificación define un flujo de autorización basado en OAuth: el usuario inicia sesión en el servicio y el agente recibe un token limitado en vez de una contraseña.
Así encaja la lista de funciones de Muse en MCP:
| Muse puede | Claude + MCP usa | Qué obtiene el agente |
|---|---|---|
| Leer y enviar correo | Servidor MCP o conector de Gmail | Buscar hilos, redactar, enviar con permisos OAuth |
| Gestionar tu calendario | Servidor MCP de Google Calendar | Huecos libres, eventos nuevos, cambios |
| Trabajar con archivos | Servidor MCP de Google Drive | Buscar, leer y escribir documentos y hojas |
| Código (no es foco de Muse) | Servidor MCP de GitHub | Issues, pull requests, búsqueda en repos |
| Navegar y rellenar formularios | Servidor MCP de Playwright o Claude in Chrome | Navegar, hacer clic, leer y escribir en un navegador real |
| Recordar tus datos | Servidor MCP de Postgres, SQLite o Supabase | Filas que el agente consulta y actualiza después |
| Trabajar en segundo plano | Una cola o planificador expuesto como herramientas MCP | Encolar un trabajo y revisar su estado luego |
| Usar otros servicios | Un pequeño servidor MCP propio sobre cualquier API REST | Tu API interna como un puñado de herramientas |
Conectar servidores locales lleva unas pocas líneas de configuración. Este es el formato estándar mcpServers que leen Claude Desktop y muchos otros clientes:
{
"mcpServers": {
"browser": { "command": "npx", "args": ["@playwright/mcp@latest"] },
"github": { "command": "docker",
"args": ["run", "-i", "--rm", "-e", "GITHUB_PERSONAL_ACCESS_TOKEN",
"ghcr.io/github/github-mcp-server"] },
"postgres": { "command": "npx",
"args": ["-y", "@modelcontextprotocol/server-postgres",
"postgresql://localhost/agent"] }
}
}
Gmail, Google Calendar y Drive ya están disponibles como conectores listos en las apps de Claude, y Anthropic ofrece Claude in Chrome para navegar y tareas programadas para el trabajo recurrente. En capacidad pura, la respuesta es sí. Un agente de Claude con estos servidores lee tu correo, consulta tu calendario, rellena un formulario web y escribe en una base de datos. Lo que falta está alrededor de esas llamadas.
¿Qué tendrías que construir tú?
Los usuarios de Muse nunca ven esta parte y quienes desarrollan con Claude no pueden saltársela. Cada punto es algo que Meta construyó una vez para todos sus usuarios.
Permisos y aprobaciones
MCP le dice al cliente qué herramientas existen. No decide cuáles puede usar el agente sin preguntar. Necesitas una capa de políticas, tu propio Sentinel, que marque cada herramienta como lectura, escritura o movimiento de dinero y se detenga a esperar a una persona en las dos últimas.
OAuth y almacenamiento de credenciales
La especificación define cómo obtiene un token el cliente. Guardar los refresh tokens de cada usuario, cifrarlos, rotarlos y mantenerlos fuera del contexto del modelo sigue siendo trabajo tuyo. Muse guarda contraseñas y tarjetas donde el propio agente no puede leerlas, y tu stack debería hacer lo mismo.
Memoria
Una ventana de contexto no es memoria. Para que el agente recuerde la semana que viene qué trabajo buscas, necesitas un almacén (Postgres con embeddings es un comienzo habitual), reglas sobre qué se guarda y una página donde el usuario lo vea y lo borre.
Tareas en segundo plano
Una petición de chat termina cuando termina la respuesta. "Haz seguimiento en cinco días" necesita una cola, un planificador, workers que despierten al agente con su estado guardado y reintentos para cuando una API tarde demasiado.
Registro de auditoría
Cada llamada a herramienta, su entrada, su resultado y quién la aprobó deberían quedar en un registro de solo escritura que el usuario pueda leer. Con ese registro depuras el agente y respondes a "¿por qué envió eso?".
Seguridad frente a inyección de prompts
Un agente que navega lee textos escritos por desconocidos, y una oferta de empleo puede esconder instrucciones dirigidas a tu agente. Trata el contenido de la página como datos, limita qué herramientas se pueden usar justo después de leer contenido no fiable y deja el dinero y los mensajes detrás de una aprobación. La lectura por árbol de accesibilidad y la regla de no ejecutar JavaScript son la respuesta de Meta a este mismo problema.
Un entorno de navegador
Playwright en tu portátil sirve para pruebas. Con usuarios reales necesitas sesiones de navegador aisladas por persona, servidores donde correrlas y una vista en vivo para que el usuario mire o tome el control. Es decir, reconstruyes la Muse Secure VM.
¿Cómo se ve la arquitectura completa?
Claude está en el centro como planificador. El runtime del agente mueve el bucle: envía el contexto a Claude, recibe una llamada a herramienta, la revisa contra la política, la pasa por el cliente MCP, la registra y devuelve el resultado. Los servidores MCP y las APIs directas llegan al mundo exterior. La memoria, una cola con workers y un navegador aislado rodean el bucle. El usuario solo toca dos pantallas: aprobaciones y registro.
¿Cómo se ve esto en una tarea real?
Toma una petición digna de un anuncio de Muse: "Busca empleos remotos de React publicados esta semana, mira mi calendario para entrevistas, prepara las solicitudes, guarda mi progreso y haz seguimiento en cinco días".
- Buscar. Claude planifica las búsquedas y llama al servidor MCP de Playwright para abrir portales de empleo. El texto de las páginas se marca como no fiable. requiere entorno de navegador y reglas anti inyección
- Filtrar. Las ofertas se comparan con tus preferencias guardadas, como solo remoto y un salario mínimo, cargadas desde la memoria. requiere memoria
- Revisar agenda. El servidor de Calendar devuelve los huecos libres de las próximas dos semanas. listo con MCP
- Redactar. Claude escribe una carta de presentación para cada oferta y guarda los borradores en Drive. listo con MCP
- Aprobar. El runtime te muestra la lista y los borradores. No sale nada hasta que pulsas aprobar. requiere permisos
- Enviar y registrar. Las solicitudes aprobadas salen por el navegador o Gmail, y cada acción se escribe en el registro de auditoría y en una tabla de empleos en Postgres. requiere registro de auditoría
- Seguimiento. Un trabajo programado para el día cinco despierta al agente, que revisa Gmail y redacta seguimientos para las empresas que no respondieron. requiere tareas en segundo plano
Fíjate en qué pasos están marcados como listos. MCP y Sonnet 5.5 cubren el razonamiento y las llamadas. Los pasos pendientes son justo los que hacen que un agente sea seguro de dejar solo.
¿Dónde va por delante Muse y dónde gana Claude + MCP?
| Área | Meta Muse | Claude Sonnet 5.5 + MCP |
|---|---|---|
| Configuración | Inicias sesión y listo | Construyes y alojas el runtime |
| Integraciones | Correo, calendario, pagos, compras, apps de Meta; lista corta por ahora | Cualquier servicio con servidor MCP o API |
| Navegador | Navegador en VM gestionada, árbol de accesibilidad, sin JavaScript en páginas | Playwright o Claude in Chrome; tú eliges el aislamiento |
| Permisos | Sentinel: permitir, denegar o preguntar | Escribes tú la capa de políticas |
| Memoria | Integrada y proactiva | Eliges almacén y reglas |
| Trabajo en segundo plano | Sigue al cerrar la app | Tu cola, planificador y workers |
| Pagos | Link con tarjetas de un solo uso | Tu propia integración de pagos |
| Elección de modelo | Solo Muse Spark | Sonnet 5.5, Opus 5.5 u otro modelo con los mismos servidores |
| Control de datos | Políticas de Meta, entrenamiento activado por defecto | Tus servidores y tus reglas de retención |
| Precio | Gratis, 20 o 100 dólares al mes | 2 / 10 dólares por millón de tokens más hosting |
Muse es la opción eficiente para quien quiere resultados esta semana. Claude con MCP es la opción eficiente para un equipo que necesita un agente dentro de su propio producto, con sus propias reglas de datos y conectado a sistemas que Meta nunca va a integrar.
¿La competencia real está en el modelo o en la infraestructura?
La distancia entre modelos se acorta. Sonnet 5.5 queda a menos de dos puntos de Opus 5.5 en OSWorld y GDPval a menor precio, y los modelos medianos de todos los laboratorios mejoran cada pocos meses. Un lanzamiento de modelo no incluye una VM, un agente de permisos, una bóveda de credenciales, un planificador ni un registro de auditoría.
Meta construyó justo esas piezas, y por eso Muse parece nuevo aunque cada capacidad ya existía. Para quien desarrolla, MCP convierte casi todo el lado de herramientas en configuración. Queda el runtime: las piezas que permiten que un agente actúe mientras no estás y que después demuestren lo que hizo.
Mi lectura es que la competencia girará cada vez más en torno a la infraestructura de agentes que rodea al modelo, y no solo al modelo. La pregunta abierta es quién será dueño de esa infraestructura. Puede quedar dentro de unas pocas apps de consumo o puede armarse con piezas abiertas como MCP por cualquier desarrollador. ¿A cuál de las dos le confiarías tu correo?
Preguntas frecuentes
¿Claude Sonnet 5.5 puede navegar por la web solo?
Puede controlar un navegador en cuanto le das una herramienta de navegador, por ejemplo el servidor MCP de Playwright o Claude in Chrome. Su 80,1% en OSWorld 2.1 mide justo este tipo de uso de ordenador.
¿MCP es solo para Claude?
No. MCP es un estándar abierto alojado por la Agentic AI Foundation dentro de la Linux Foundation, y muchos clientes y herramientas de IA lo soportan.
¿Claude sigue trabajando en segundo plano como Muse?
No por defecto a través de la API. Añades ejecución en segundo plano con una cola y workers, o usas las tareas programadas de las apps de Anthropic donde estén disponibles.
¿Cuánto cuesta Meta Muse?
Muse tiene un plan gratuito y planes de pago de 20 y 100 dólares al mes, según la cobertura de lanzamiento de Tech Insider.
¿Es seguro dejar que un agente de IA envíe correos por mí?
Solo con un paso de aprobación. Muse pregunta antes de enviar correos o comprar algo. Si construyes con Claude y MCP, pon esa misma aprobación delante de cada acción de escritura.
Referencias
- Meta Newsroom: Introducing Muse (Sept 8, 2026)
- Tech Insider: Meta Muse launch, pricing tiers
- Edapt: How Meta's personal AI agent works
- MindStudio: Meta Muse explained
- VentureBeat: Claude Sonnet 5.5 launch and benchmarks
- TechCrunch: Anthropic releases Sonnet 5.5
- The Decoder: Sonnet 5.5 nearly matches Opus 5.5
- MCP Blog: MCP joins the Agentic AI Foundation
- Model Context Protocol specification
- Playwright MCP server
- GitHub MCP server
मेटा ने MUSE बना लिया।क्या CLAUDE + MCP यह पहले से कर सकते हैं?
Claude Sonnet 5.5 बनाम Meta Muse: क्या MCP, Claude को पूरा AI एजेंट बना सकता है?
Sonnet 5.5 आज रिलीज़ हुआ और Muse तीन हफ़्ते पहले आया। एक मॉडल है, दूसरा तैयार प्रोडक्ट। इस लेख में Muse को हिस्सों में खोलकर देखा गया है कि उसका कितना हिस्सा Claude और Model Context Protocol से दोबारा बनाया जा सकता है।
मुख्य तथ्य
- मेटा ने 8 सितंबर 2026 को Muse की घोषणा की। यह Muse Spark नाम के मॉडल पर चलता है और अमेरिका में iOS, Android, वेब और WhatsApp पर रोलआउट हो रहा है।
- Tech Insider के अनुसार Muse का एक फ़्री प्लान है, और 20 डॉलर तथा 100 डॉलर प्रति माह के पेड प्लान हैं।
- Anthropic ने 28 सितंबर 2026 को Claude Sonnet 5.5 जारी किया। कीमत 2 डॉलर प्रति मिलियन इनपुट टोकन और 10 डॉलर प्रति मिलियन आउटपुट टोकन है, यानी Sonnet 5 जितनी।
- कंप्यूटर-यूज़ बेंचमार्क OSWorld 2.1 पर Sonnet 5.5 का स्कोर 80.1% है। Sonnet 5 का स्कोर 57% था।
- MCP एक ओपन प्रोटोकॉल है जिसे Anthropic ने नवंबर 2024 में पेश किया और दिसंबर 2025 में Linux Foundation की Agentic AI Foundation को सौंप दिया।
क्या Muse ज़्यादा समझदार AI है, या बस बेहतर औज़ारों वाला?
मेटा ने Muse को एक पूरे निजी AI एजेंट के रूप में बनाया। लेकिन अगर Claude Sonnet 5.5 पहले से सोच सकता है, टूल इस्तेमाल कर सकता है, वेब ब्राउज़ कर सकता है और MCP के ज़रिए बाहरी ऐप्स से जुड़ सकता है, तो Muse में सच में नया कितना है, और कितना हिस्सा एक AI मॉडल के चारों ओर बना बढ़िया इंफ्रास्ट्रक्चर है?
Muse ब्राउज़र खोल सकता है, फ़ॉर्म भर सकता है, ईमेल भेज सकता है, यात्रा प्लान कर सकता है, ख़रीदारी कर सकता है, और ऐप बंद करने के बाद भी काम करता रहता है। मेटा इसे सबके लिए बना निजी एजेंट कहता है। उसी महीने Anthropic ने Sonnet 5.5 जारी किया और इसे तेज़ और सस्ता वर्क पार्टनर बताया जो काम पूरा करने के लिए कम टूल कॉल करता है।
दोनों लॉन्च अलग सवालों के जवाब हैं। Muse बताता है कि बिना किसी सेटअप के आज एक एजेंट मेरे लिए क्या कर सकता है। Sonnet 5.5 बताता है कि मैं अपने एजेंट में जो दिमाग़ लगाऊँ, वह कितना अच्छा है। अगर आप सॉफ़्टवेयर बनाते हैं तो दूसरा सवाल सीधे तीसरे पर ले जाता है: अगर मैं Sonnet 5.5 को मेल, कैलेंडर, कोड और ब्राउज़र के MCP सर्वर से जोड़ दूँ, तो मैं Muse के कितना क़रीब पहुँचूँगा?
मैं क्लाइंट्स के लिए वेब ऐप्स और AI इंटीग्रेशन बनाता हूँ, इसलिए मैंने दोनों लॉन्च को एक-एक हिस्सा करके देखा। नीचे Muse को हिस्सों में बाँटा गया है, हर हिस्से को Claude और MCP की मौजूदा क्षमता से मिलाया गया है, और जो बचा उसे बनाने की सूची में डाला गया है।
Claude Sonnet 5.5 क्या है, और इसमें क्या बदला?
Claude Sonnet 5.5 Anthropic का मध्यम आकार का मॉडल है, जो 28 सितंबर 2026 को मॉडल ID claude-sonnet-5-5 के साथ जारी हुआ। लाइनअप में यह Opus 5.5 से नीचे है, पर ज़्यादातर एजेंट बेंचमार्क पर उससे कुछ ही अंक पीछे रहता है और सस्ता है।
यह लॉन्च मुख्य रूप से दक्षता के बारे में था। Anthropic के अनुसार Sonnet 5.5, Sonnet 5 से लगभग 30% तेज़ आउटपुट देता है और किसी काम की लागत 30% तक घटा सकता है, ज़्यादातर इसलिए कि यह कम टोकन और कम टूल कॉल खर्च करता है। Lovable ने अपने बिल्ड में लगभग एक तिहाई कम टूल कॉल बताए। Box ने बताया कि काम 2.4 गुना तेज़ हुआ और टोकन 12% कम लगे। The Decoder के मुताबिक़ यह मॉडल पिछले मॉडल से बेहतर तरीक़े से टूल कॉल को बैच करता है, और जब हर कॉल नेटवर्क पर MCP सर्वर तक जाती है तो यह बात बहुत मायने रखती है।
| बेंचमार्क | Sonnet 5.5 | Opus 5.5 | Sonnet 5 |
|---|---|---|---|
| OSWorld 2.1 (कंप्यूटर यूज़) | 80.1% | 81.8% | 57% |
| Terminal-Bench 4.0 (टर्मिनल पर एजेंट का काम) | 70.6% | 66.4% | 10.3% |
| GDPval-AA (नॉलेज वर्क, Elo) | 1844 | 1846 | 1449 |
| CursorBench 4.0 (कोडिंग) | 55.5% | 57.8% | उपलब्ध नहीं |
एजेंट बनाने वालों के लिए दो बातें और अहम हैं। Sonnet 5.5 में effort का स्तर बदला जा सकता है, यानी रोज़ का बैकग्राउंड चेक कम effort पर और प्लानिंग वाला कदम ज़्यादा effort पर चल सकता है। यह Claude API, AWS, Google Cloud और Microsoft Azure पर भी उपलब्ध है, इसलिए जिस क्लाउड का आप पहले से इस्तेमाल करते हैं, वहीं इसे रख सकते हैं।
Sonnet 5.5 के साथ आपका इनबॉक्स नहीं आता। मॉडल तय करता है कि क्या करना है और टूल माँगता है। वह टूल देना, लॉगिन सँभालना और चैट बंद होने के बाद लूप चलाए रखना किसी और हिस्से का काम है।
Meta Muse क्या है, और यह कैसे काम करता है?
Muse मेटा का आम यूज़र्स के लिए एजेंट है, जिसकी घोषणा 8 सितंबर 2026 को हुई। यह Muse Spark पर चलता है, जिसे मेटा असली दुनिया के एजेंटिक काम के लिए अपना सबसे सक्षम मॉडल बताता है। यह iOS और Android ऐप, वेब और WhatsApp के अंदर मिलता है। AI चश्मे का सपोर्ट बाद में आने की घोषणा है।
मॉडल सिर्फ़ एक हिस्सा है। मेटा की घोषणा और शुरुआती रिपोर्ट्स के अनुसार ये हिस्से साथ आते हैं:
- हर यूज़र के लिए अलग वर्चुअल मशीन, Muse Secure VM, जिसका अपना ब्राउज़र और स्टोरेज है।
- Sentinel नाम का अलग निगरानी एजेंट, जो कनेक्टर अनुरोधों और बाहर जाने वाली नेटवर्क कॉल को आपकी सेटिंग्स से मिलाता है, फिर अनुमति देता है, रोकता है या आपसे पूछता है (Edapt के अनुसार)।
- ईमेल भेजने या ख़रीदारी जैसे संवेदनशील काम से पहले मंज़ूरी का संकेत, और एजेंट के हर काम का पूरा ऑडिट ट्रेल।
- आपकी दिनचर्या और एक बार कही गई बातों की मेमोरी, जिससे Muse बिना पूछे काम सुझाता है।
- बैकग्राउंड में काम। ऐप बंद करने के बाद भी Muse चलता रहता है और फ़ैसले की ज़रूरत पर लौटता है।
- लॉन्च पर Stripe के Link से भुगतान, जबकि Shop Pay और 1Password का सपोर्ट बाद में आने की घोषणा है।
ब्राउज़र वाला हिस्सा ध्यान से देखने लायक है। Edapt के अनुसार Muse पेज का कच्चा कोड पढ़ने के बजाय उसका accessibility tree पढ़ता है, पेज के अंदर JavaScript नहीं चला सकता, और जब आप कंट्रोल लें या कोई सेव किया पासवर्ड भरा जा रहा हो तो रुक जाता है। यह सावधान डिज़ाइन है। बिखरी वेबसाइटों पर एजेंट की लचक थोड़ी घटती है, पर बदनीयत पेज के लिए उसे भटकाना मुश्किल हो जाता है।
Muse के कौन से हिस्से सबसे कुशल हैं?
सबसे ज़्यादा समय सेटअप में बचता है। आपको OAuth कोड नहीं लिखना पड़ता, मेमोरी के लिए डेटाबेस नहीं चुनना पड़ता और ब्राउज़र होस्ट नहीं करना पड़ता। मंज़ूरियाँ और ऑडिट ट्रेल पहले मिनट से काम करते हैं। भुगतान एक बार इस्तेमाल होने वाले कार्ड नंबर से होता है जो एक दुकान, एक सीमा और थोड़े समय से बँधे होते हैं, जिससे शॉपिंग एजेंट का एक पूरा जोखिम ख़त्म हो जाता है। जो व्यक्ति कोड नहीं लिखता, उसके लिए यही पैकेज पूरा प्रोडक्ट है।
सीमाएँ भी इसी पैकेज से आती हैं। अब तक की रिपोर्ट्स के अनुसार इंटीग्रेशन डेवलपर एजेंट टूल से कम हैं, सेवा सिर्फ़ अमेरिका में वयस्कों के लिए है, और Edapt के अनुसार बीटा टेस्टर्स ने कनेक्शन टूटने और कम से कम एक ऐसे एजेंट की बात कही जो छोटे काम से आगे बढ़ गया। बातचीत डिफ़ॉल्ट रूप से आगे के मॉडल की ट्रेनिंग में इस्तेमाल होती है, जब तक आप इसे बंद न करें।
तो असल में तुलना किस चीज़ की है?
ज़्यादातर "Claude बनाम Muse" राय एक मॉडल को एक प्रोडक्ट के बगल में खड़ा कर देती हैं। लिखकर देखें तो तुलना ऐसी बनती है:
Claude Sonnet 5.5 = बुद्धि / मॉडल
Meta Muse = मॉडल + इंफ्रास्ट्रक्चर + टूल्स + रनटाइम
Sonnet 5.5 का मुक़ाबला Muse Spark से है। प्रोडक्ट के रूप में Muse एक एजेंट स्टैक से मुक़ाबला करता है, और ऐसा स्टैक Claude के चारों ओर बनाया जा सकता है। काम का सवाल यह है कि उस स्टैक का कितना हिस्सा ओपन पुर्ज़ों के रूप में पहले से मौजूद है। उनमें सबसे बड़ा पुर्ज़ा MCP है।
क्या Claude + MCP वह सब कर सकते हैं जो Muse करता है?
Model Context Protocol एक ओपन स्टैंडर्ड है जो AI ऐप्स को टूल और डेटा से जोड़ता है। MCP सर्वर टूल (जैसे "इवेंट बनाओ"), रिसोर्स (जैसे कोई फ़ाइल) और प्रॉम्प्ट देता है। MCP क्लाइंट, चाहे वह Claude का कोई ऐप हो या Claude API पर आपका लिखा एजेंट, इन सर्वरों से जुड़ता है और मॉडल को इन्हें कॉल करने देता है। रिमोट सर्वर के लिए स्पेसिफ़िकेशन OAuth पर आधारित ऑथराइज़ेशन तय करता है, यानी यूज़र सेवा में खुद साइन इन करता है और एजेंट को पासवर्ड की जगह सीमित टोकन मिलता है।
Muse की सुविधाएँ MCP पर ऐसे बैठती हैं:
| Muse क्या करता है | Claude + MCP क्या इस्तेमाल करता है | एजेंट को क्या मिलता है |
|---|---|---|
| ईमेल पढ़ना और भेजना | Gmail MCP सर्वर या कनेक्टर | थ्रेड खोजना, ड्राफ़्ट, OAuth स्कोप के साथ भेजना |
| कैलेंडर सँभालना | Google Calendar MCP सर्वर | ख़ाली स्लॉट, नए इवेंट, बदलाव |
| फ़ाइलों पर काम | Google Drive MCP सर्वर | डॉक्स और शीट खोजना, पढ़ना, लिखना |
| कोड (Muse का फ़ोकस नहीं) | GitHub MCP सर्वर | इश्यू, पुल रिक्वेस्ट, रिपो सर्च |
| ब्राउज़ करना और फ़ॉर्म भरना | Playwright MCP सर्वर या Claude in Chrome | असली ब्राउज़र में जाना, क्लिक, पढ़ना, टाइप करना |
| आपका डेटा याद रखना | Postgres, SQLite या Supabase MCP सर्वर | रिकॉर्ड जिन्हें एजेंट बाद में पढ़ और बदल सके |
| बैकग्राउंड में काम | MCP टूल के रूप में क्यू या शेड्यूलर | जॉब क्यू में डालना, बाद में स्टेटस देखना |
| दूसरी सेवाएँ | किसी भी REST API पर छोटा कस्टम MCP सर्वर | आपकी अंदरूनी API कुछ टूल्स के रूप में |
लोकल सर्वर जोड़ने के लिए कुछ लाइनों का कॉन्फ़िग काफ़ी है। यह वही मानक mcpServers फ़ॉर्मेट है जिसे Claude Desktop और कई दूसरे क्लाइंट पढ़ते हैं:
{
"mcpServers": {
"browser": { "command": "npx", "args": ["@playwright/mcp@latest"] },
"github": { "command": "docker",
"args": ["run", "-i", "--rm", "-e", "GITHUB_PERSONAL_ACCESS_TOKEN",
"ghcr.io/github/github-mcp-server"] },
"postgres": { "command": "npx",
"args": ["-y", "@modelcontextprotocol/server-postgres",
"postgresql://localhost/agent"] }
}
}
Gmail, Google Calendar और Drive, Claude के ऐप्स में तैयार कनेक्टर के रूप में मौजूद हैं, और Anthropic ब्राउज़िंग के लिए Claude in Chrome और बार-बार होने वाले काम के लिए scheduled tasks पहले से देता है। यानी सिर्फ़ क्षमता की बात करें तो जवाब हाँ है। इन सर्वरों वाला Claude एजेंट आपका इनबॉक्स पढ़ सकता है, कैलेंडर देख सकता है, वेब फ़ॉर्म भर सकता है और डेटाबेस में लिख सकता है। कमी इन कॉल्स के आसपास है।
फिर आपको खुद क्या बनाना होगा?
Muse के यूज़र यह हिस्सा कभी नहीं देखते, और Claude पर बनाने वाले डेवलपर इसे छोड़ नहीं सकते। नीचे की हर चीज़ मेटा ने एक बार, सभी यूज़र्स के लिए बनाई।
अनुमतियाँ और मंज़ूरियाँ
MCP क्लाइंट को बताता है कि कौन से टूल मौजूद हैं। यह तय नहीं करता कि एजेंट कौन सा टूल बिना पूछे चला सकता है। इसके लिए पॉलिसी की परत चाहिए, यानी आपका अपना Sentinel, जो हर टूल को पढ़ने, लिखने या पैसे भेजने वाला बताए और आख़िरी दो पर इंसान का इंतज़ार करे।
OAuth और क्रेडेंशियल स्टोरेज
स्पेसिफ़िकेशन बताता है कि क्लाइंट टोकन कैसे ले। हर यूज़र के refresh टोकन सहेजना, एन्क्रिप्ट करना, बदलते रहना और उन्हें मॉडल के कॉन्टेक्स्ट से दूर रखना फिर भी आपका काम है। Muse पासवर्ड और कार्ड की जानकारी वहाँ रखता है जहाँ एजेंट खुद उन्हें नहीं पढ़ सकता, और आपके स्टैक को भी यही करना चाहिए।
मेमोरी
कॉन्टेक्स्ट विंडो मेमोरी नहीं है। अगर एजेंट को अगले हफ़्ते भी आपकी नौकरी की पसंद याद रखनी है, तो एक स्टोर चाहिए (आम शुरुआत Postgres और embeddings से होती है), यह नियम कि क्या सहेजा जाए, और एक पेज जहाँ यूज़र उसे देख और मिटा सके।
बैकग्राउंड जॉब
चैट अनुरोध जवाब के साथ ख़त्म हो जाता है। "पाँच दिन बाद फ़ॉलो-अप करना" के लिए क्यू, शेड्यूलर, ऐसे वर्कर जो सहेजी स्थिति के साथ एजेंट को जगाएँ, और API टाइमआउट पर दोबारा कोशिश की व्यवस्था चाहिए।
ऑडिट लॉग
हर टूल कॉल, उसका इनपुट, नतीजा और मंज़ूरी देने वाले का नाम ऐसे लॉग में जाना चाहिए जिसमें सिर्फ़ जोड़ा जा सके और जिसे यूज़र पढ़ सके। इसी से आप एजेंट को डीबग करते हैं और इसी से इस सवाल का जवाब देते हैं कि "इसने वह क्यों भेजा?"
प्रॉम्प्ट इंजेक्शन से सुरक्षा
ब्राउज़ करने वाला एजेंट अजनबियों का लिखा टेक्स्ट पढ़ता है, और किसी नौकरी के विज्ञापन में आपके एजेंट के लिए छिपे निर्देश हो सकते हैं। पेज के टेक्स्ट को सिर्फ़ डेटा मानें, अविश्वसनीय टेक्स्ट पढ़ने के तुरंत बाद चलने वाले टूल सीमित करें, और पैसे व संदेशों को मंज़ूरी के पीछे रखें। Muse का accessibility tree पढ़ना और JavaScript न चलाने का नियम इसी समस्या का मेटा वाला हल है।
ब्राउज़र का माहौल
टेस्टिंग के लिए लैपटॉप पर Playwright काफ़ी है। असली यूज़र्स के लिए हर व्यक्ति का अलग ब्राउज़र सेशन, उन्हें चलाने के लिए सर्वर, और एक लाइव व्यू चाहिए ताकि यूज़र देख सके या कंट्रोल ले सके। सीधी बात, आप Muse Secure VM दोबारा बना रहे हैं।
पूरा आर्किटेक्चर कैसा दिखता है?
Claude बीच में योजनाकार के रूप में बैठा है। एजेंट रनटाइम लूप चलाता है: Claude को कॉन्टेक्स्ट भेजता है, टूल कॉल लेता है, उसे पॉलिसी से जाँचता है, MCP क्लाइंट से आगे भेजता है, लॉग करता है और नतीजा वापस देता है। MCP सर्वर और सीधी API बाहर की दुनिया तक पहुँचते हैं। मेमोरी, वर्कर वाली जॉब क्यू और अलग ब्राउज़र लूप के चारों ओर हैं। यूज़र सिर्फ़ दो स्क्रीन देखता है: मंज़ूरियाँ और लॉग।
असली काम पर यह कैसा दिखता है?
एक ऐसा अनुरोध लीजिए जो Muse के विज्ञापन में चल सकता है: "इस हफ़्ते की रिमोट React नौकरियाँ ढूँढो, इंटरव्यू के लिए मेरा कैलेंडर देखो, आवेदन तैयार करो, मेरी प्रगति सहेजो और पाँच दिन बाद फ़ॉलो-अप करो।"
- खोज। Claude सर्च की योजना बनाता है और जॉब बोर्ड खोलने के लिए Playwright MCP सर्वर को कॉल करता है। पेज का टेक्स्ट अविश्वसनीय माना जाता है। ब्राउज़र माहौल और इंजेक्शन नियम चाहिए
- छँटाई। विज्ञापनों को मेमोरी में सहेजी आपकी पसंद से मिलाया जाता है, जैसे सिर्फ़ रिमोट और न्यूनतम वेतन। मेमोरी चाहिए
- समय देखना। Calendar सर्वर अगले दो हफ़्तों के ख़ाली स्लॉट देता है। MCP से तैयार
- ड्राफ़्ट। Claude हर नौकरी के लिए अलग कवर लेटर लिखकर Drive में सहेजता है। MCP से तैयार
- मंज़ूरी। रनटाइम आपको सूची और ड्राफ़्ट दिखाता है। आपके approve दबाने तक कुछ नहीं जाता। अनुमतियाँ चाहिए
- जमा और लॉग। मंज़ूर आवेदन ब्राउज़र या Gmail से जाते हैं, और हर कार्रवाई ऑडिट लॉग और Postgres की jobs टेबल में लिखी जाती है। ऑडिट लॉग चाहिए
- फ़ॉलो-अप। पाँचवें दिन की शेड्यूल की गई जॉब एजेंट को जगाती है। वह Gmail में जवाब देखता है और चुप रहने वाली कंपनियों के लिए विनम्र फ़ॉलो-अप ड्राफ़्ट करता है। बैकग्राउंड जॉब चाहिए
देखिए कौन से कदम तैयार हैं। MCP और Sonnet 5.5 सोचने और कॉल करने का काम सँभाल लेते हैं। जिन कदमों पर काम बाक़ी है, वही एजेंट को अकेला छोड़ने लायक़ बनाते हैं।
Muse कहाँ आगे है, और Claude + MCP कहाँ जीतता है?
| क्षेत्र | Meta Muse | Claude Sonnet 5.5 + MCP |
|---|---|---|
| सेटअप | साइन इन करें और शुरू | रनटाइम आप बनाते और होस्ट करते हैं |
| इंटीग्रेशन | ईमेल, कैलेंडर, भुगतान, शॉपिंग, मेटा ऐप्स; अभी छोटी सूची | हर वह सेवा जिसका MCP सर्वर या API हो |
| ब्राउज़र | मैनेज्ड VM ब्राउज़र, accessibility tree, पेज पर JavaScript नहीं | Playwright या Claude in Chrome; अलगाव आप तय करते हैं |
| अनुमतियाँ | Sentinel: अनुमति, इनकार या सवाल | पॉलिसी परत आप लिखते हैं |
| मेमोरी | पहले से मौजूद और खुद सुझाव देती है | स्टोर और नियम आप चुनते हैं |
| बैकग्राउंड काम | ऐप बंद होने के बाद भी जारी | आपकी क्यू, शेड्यूलर और वर्कर |
| भुगतान | Link और एक बार वाले कार्ड | आपका अपना पेमेंट इंटीग्रेशन |
| मॉडल का चुनाव | सिर्फ़ Muse Spark | Sonnet 5.5, Opus 5.5 या कोई और मॉडल, वही सर्वर |
| डेटा नियंत्रण | मेटा की नीतियाँ, ट्रेनिंग डिफ़ॉल्ट रूप से चालू | आपके सर्वर और आपके नियम |
| कीमत | फ़्री, 20 या 100 डॉलर प्रति माह | 2 / 10 डॉलर प्रति मिलियन टोकन, साथ में होस्टिंग |
जो व्यक्ति इसी हफ़्ते नतीजा चाहता है, उसके लिए Muse ज़्यादा कुशल है। जिस टीम को अपने प्रोडक्ट के अंदर, अपने डेटा नियमों के साथ, और ऐसे सिस्टम से जुड़ा एजेंट चाहिए जिन्हें मेटा कभी नहीं जोड़ेगा, उसके लिए Claude और MCP बेहतर हैं।
असली मुक़ाबला मॉडल का है या इंफ्रास्ट्रक्चर का?
मॉडलों का फ़र्क़ कम होता जा रहा है। Sonnet 5.5, OSWorld और GDPval पर Opus 5.5 से दो अंकों के अंदर है और सस्ता है, और हर लैब के मध्यम मॉडल कुछ महीनों में बेहतर हो जाते हैं। मॉडल रिलीज़ के साथ VM, अनुमति वाला एजेंट, क्रेडेंशियल वॉल्ट, शेड्यूलर या ऑडिट ट्रेल नहीं आते।
मेटा ने ठीक यही हिस्से बनाए, और इसीलिए Muse नया लगता है, भले हर क्षमता पहले से मौजूद थी। डेवलपर्स के लिए MCP टूल वाले ज़्यादातर काम को कॉन्फ़िगरेशन बना देता है। बचता है रनटाइम: वे हिस्से जो आपकी ग़ैरमौजूदगी में एजेंट को काम करने देते हैं और बाद में साबित करते हैं कि उसने क्या किया।
मेरी राय में मुक़ाबला धीरे-धीरे मॉडल के चारों ओर के एजेंट इंफ्रास्ट्रक्चर पर ज़्यादा होगा, सिर्फ़ मॉडल पर नहीं। खुला सवाल यह है कि उस इंफ्रास्ट्रक्चर का मालिक कौन होगा। यह कुछ कंज़्यूमर ऐप्स के अंदर बंद रह सकता है, या MCP जैसे ओपन पुर्ज़ों से कोई भी डेवलपर इसे जोड़ सकता है। आप अपने इनबॉक्स के लिए किस पर भरोसा करेंगे?
अक्सर पूछे जाने वाले सवाल
क्या Claude Sonnet 5.5 खुद वेब ब्राउज़ कर सकता है?
जब आप उसे ब्राउज़र टूल देते हैं, जैसे Playwright MCP सर्वर या Claude in Chrome, तो वह ब्राउज़र चला सकता है। OSWorld 2.1 पर उसका 80.1% स्कोर इसी तरह के कंप्यूटर यूज़ को मापता है।
क्या MCP सिर्फ़ Claude के लिए है?
नहीं। MCP एक ओपन स्टैंडर्ड है जो Linux Foundation की Agentic AI Foundation के तहत है, और कई AI क्लाइंट और टूल इसे सपोर्ट करते हैं।
क्या Claude भी Muse की तरह बैकग्राउंड में काम करता रहता है?
API के ज़रिए डिफ़ॉल्ट रूप से नहीं। बैकग्राउंड काम के लिए क्यू और वर्कर जोड़ने होते हैं, या जहाँ उपलब्ध हों वहाँ Anthropic के ऐप्स के scheduled tasks इस्तेमाल किए जा सकते हैं।
Meta Muse की कीमत क्या है?
Tech Insider की लॉन्च रिपोर्ट के अनुसार Muse का फ़्री प्लान है, और 20 डॉलर और 100 डॉलर प्रति माह के पेड प्लान हैं।
क्या AI एजेंट को अपनी ओर से ईमेल भेजने देना सुरक्षित है?
सिर्फ़ मंज़ूरी वाले कदम के साथ। Muse ईमेल भेजने या कुछ ख़रीदने से पहले पूछता है। अगर आप Claude और MCP से बनाते हैं, तो हर लिखने वाली कार्रवाई के आगे यही मंज़ूरी रखें।
संदर्भ
- Meta Newsroom: Introducing Muse (Sept 8, 2026)
- Tech Insider: Meta Muse launch, pricing tiers
- Edapt: How Meta's personal AI agent works
- MindStudio: Meta Muse explained
- VentureBeat: Claude Sonnet 5.5 launch and benchmarks
- TechCrunch: Anthropic releases Sonnet 5.5
- The Decoder: Sonnet 5.5 nearly matches Opus 5.5
- MCP Blog: MCP joins the Agentic AI Foundation
- Model Context Protocol specification
- Playwright MCP server
- GitHub MCP server
META СДЕЛАЛА MUSE.А CLAUDE + MCP УЖЕ УМЕЮТ ЭТО?
Claude Sonnet 5.5 против Meta Muse: может ли MCP превратить Claude в полноценного ИИ-агента?
Sonnet 5.5 вышел сегодня, Muse три недели назад. Первый это модель, второй готовый продукт. Здесь я разбираю Muse на части и проверяю, сколько из него можно собрать заново на Claude и Model Context Protocol.
Ключевые факты
- Meta анонсировала Muse 8 сентября 2026 года. Он работает на модели Muse Spark и запускается в США на iOS, Android, в вебе и в WhatsApp.
- По данным Tech Insider, у Muse есть бесплатный тариф и платные за 20 и 100 долларов в месяц.
- Anthropic выпустила Claude Sonnet 5.5 28 сентября 2026 года по цене 2 доллара за миллион входных токенов и 10 долларов за миллион выходных, как у Sonnet 5.
- Sonnet 5.5 набирает 80,1% в OSWorld 2.1, тесте на работу с компьютером. У Sonnet 5 было 57%.
- MCP это открытый протокол, который Anthropic представила в ноябре 2024 года и в декабре 2025 года передала в Agentic AI Foundation при Linux Foundation.
Muse умнее или просто лучше оснащён?
Meta создала Muse как полноценного персонального ИИ-агента. Но если Claude Sonnet 5.5 уже умеет рассуждать, пользоваться инструментами, ходить по сайтам и подключаться к внешним приложениям через MCP, то сколько в Muse действительно нового, а сколько просто хорошей инфраструктуры вокруг ИИ-модели?
Muse открывает браузер, заполняет формы, отправляет письма, планирует поездки, делает покупки и продолжает работать после того, как вы закрыли приложение. Meta называет его персональным агентом для всех. В том же месяце Anthropic выпустила Sonnet 5.5 и описала его как более быстрого и дешёвого рабочего помощника, которому нужно меньше вызовов инструментов, чтобы закончить задачу.
Эти запуски отвечают на разные вопросы. Muse отвечает на вопрос «что агент может сделать для меня сегодня без всякой настройки?». Sonnet 5.5 отвечает на вопрос «насколько хорош мозг, который я поставлю в своего агента?». Если вы пишете код, второй вопрос сразу ведёт к третьему: если подключить Sonnet 5.5 к MCP-серверам для почты, календаря, кода и браузера, насколько близко я подойду к Muse?
Я делаю веб-приложения и ИИ-интеграции для клиентов, поэтому разобрал оба запуска по частям. Ниже Muse разложен на компоненты, каждый компонент сопоставлен с тем, что уже дают Claude и MCP, а всё остальное попало в список того, что нужно построить.
Что такое Claude Sonnet 5.5 и что изменилось?
Claude Sonnet 5.5 это модель среднего размера от Anthropic, вышедшая 28 сентября 2026 года с идентификатором claude-sonnet-5-5. В линейке она стоит ниже Opus 5.5, но в большинстве агентных тестов отстаёт от неё на пару пунктов и стоит дешевле.
Главной темой запуска была эффективность. По словам Anthropic, Sonnet 5.5 генерирует текст примерно на 30% быстрее Sonnet 5 и может снизить стоимость задачи до 30%, в основном за счёт меньшего числа токенов и вызовов инструментов. Lovable сообщила, что в её сборках вызовов стало примерно на треть меньше. Box сообщила об ускорении в 2,4 раза и на 12% меньшем расходе токенов. The Decoder добавляет, что модель лучше группирует вызовы инструментов, а это очень важно, когда каждый вызов идёт по сети к MCP-серверу.
| Тест | Sonnet 5.5 | Opus 5.5 | Sonnet 5 |
|---|---|---|---|
| OSWorld 2.1 (работа с компьютером) | 80,1% | 81,8% | 57% |
| Terminal-Bench 4.0 (агентная работа в терминале) | 70,6% | 66,4% | 10,3% |
| GDPval-AA (интеллектуальный труд, Elo) | 1844 | 1846 | 1449 |
| CursorBench 4.0 (программирование) | 55,5% | 57,8% | нет данных |
Для тех, кто строит агентов, важны ещё две детали. У Sonnet 5.5 есть настраиваемые уровни усилия, так что рутинная фоновая проверка может идти на низком уровне, а шаг планирования на высоком. Модель доступна через Claude API, AWS, Google Cloud и Microsoft Azure, поэтому её можно запустить в том облаке, за которое вы уже платите.
В комплекте с Sonnet 5.5 не идёт ваш почтовый ящик. Модель решает, что делать, и просит инструмент. Кто-то другой должен этот инструмент предоставить, хранить логин и держать цикл работающим после закрытия чата.
Что такое Meta Muse и как он работает?
Muse это потребительский агент Meta, анонсированный 8 сентября 2026 года. Он работает на Muse Spark, которую Meta называет своей самой способной моделью для реальной агентной работы. Им можно пользоваться в приложениях для iOS и Android, в вебе и внутри WhatsApp. Поддержку ИИ-очков обещают позже.
Модель лишь одна из частей. Анонс Meta и первые обзоры описывают набор, который поставляется вместе:
- Отдельная виртуальная машина на каждого пользователя, Muse Secure VM, со своим браузером и хранилищем.
- Отдельный надзорный агент Sentinel, который сверяет запросы к коннекторам и исходящие сетевые вызовы с вашими настройками, а затем разрешает их, блокирует или спрашивает вас (по данным Edapt).
- Запрос подтверждения перед чувствительными действиями вроде отправки письма или покупки и полный журнал всего, что сделал агент.
- Память о ваших привычках и о том, что вы упомянули один раз. Muse использует её, чтобы предлагать действия сам.
- Фоновое выполнение. Muse продолжает работать после закрытия приложения и возвращается, когда нужно ваше решение.
- Оплата через Link от Stripe с первого дня, а поддержку Shop Pay и 1Password обещают позже.
Браузер стоит рассмотреть внимательнее. По данным Edapt, Muse читает дерево доступности страницы вместо исходного кода, не может выполнять JavaScript на страницах и останавливается, когда вы берёте управление или когда подставляется сохранённый пароль. Это осторожный подход. На запутанных сайтах агент теряет часть гибкости, зато вредоносной странице труднее им управлять.
В чём Muse особенно эффективен?
Больше всего времени Muse экономит на настройке. Не нужно писать код OAuth, выбирать базу данных для памяти или держать свой браузер. Подтверждения и журнал работают с первой минуты. Оплата идёт одноразовыми номерами карт, привязанными к одному магазину, сумме и короткому сроку, что убирает целый класс рисков у агента для покупок. Для человека, который не программирует, весь продукт и есть этот набор.
Ограничения растут из того же набора. По имеющимся обзорам, интеграций меньше, чем у агентных инструментов для разработчиков, сервис доступен только взрослым в США, а по данным Edapt бета-тестеры сталкивались с обрывами связи и как минимум с одним агентом, который вышел за рамки узкой задачи. Кроме того, разговоры по умолчанию используются для обучения будущих моделей, пока вы это не отключите.
Так что мы на самом деле сравниваем?
Большинство сравнений «Claude против Muse» ставят модель рядом с продуктом. Если записать, получится так:
Claude Sonnet 5.5 = интеллект / модель
Meta Muse = модель + инфраструктура + инструменты + рантайм
Sonnet 5.5 соревнуется с Muse Spark. Muse как продукт соревнуется с агентным стеком, а такой стек можно собрать вокруг Claude. Полезный вопрос в том, какая часть этого стека уже существует в виде открытых компонентов. Самый крупный из них это MCP.
Могут ли Claude + MCP делать то же, что Muse?
Model Context Protocol это открытый стандарт для подключения ИИ-приложений к инструментам и данным. MCP-сервер предоставляет инструменты (действия вроде «создать событие»), ресурсы (данные вроде файла) и промпты. MCP-клиент, будь то приложение Claude или ваш агент на Claude API, подключается к этим серверам и даёт модели их вызывать. Для удалённых серверов спецификация описывает авторизацию на основе OAuth: пользователь сам входит в сервис, а агент получает ограниченный токен вместо пароля.
Вот как функции Muse ложатся на MCP:
| Muse умеет | Claude + MCP использует | Что получает агент |
|---|---|---|
| Читать и отправлять почту | MCP-сервер или коннектор Gmail | Поиск писем, черновики, отправка с правами OAuth |
| Вести календарь | MCP-сервер Google Calendar | Свободные слоты, новые события, изменения |
| Работать с файлами | MCP-сервер Google Drive | Поиск, чтение и запись документов и таблиц |
| Код (не фокус Muse) | MCP-сервер GitHub | Issues, pull requests, поиск по репозиториям |
| Ходить по сайтам и заполнять формы | MCP-сервер Playwright или Claude in Chrome | Переходы, клики, чтение и ввод в настоящем браузере |
| Помнить ваши данные | MCP-сервер Postgres, SQLite или Supabase | Записи, которые агент потом прочитает и обновит |
| Работать в фоне | Очередь или планировщик в виде MCP-инструментов | Поставить задачу и позже проверить статус |
| Другие сервисы | Небольшой свой MCP-сервер поверх любого REST API | Ваш внутренний API как несколько инструментов |
Подключение локальных серверов занимает несколько строк конфигурации. Это стандартный формат mcpServers, который читают Claude Desktop и многие другие клиенты:
{
"mcpServers": {
"browser": { "command": "npx", "args": ["@playwright/mcp@latest"] },
"github": { "command": "docker",
"args": ["run", "-i", "--rm", "-e", "GITHUB_PERSONAL_ACCESS_TOKEN",
"ghcr.io/github/github-mcp-server"] },
"postgres": { "command": "npx",
"args": ["-y", "@modelcontextprotocol/server-postgres",
"postgresql://localhost/agent"] }
}
}
Gmail, Google Calendar и Drive доступны как готовые коннекторы в приложениях Claude, а Anthropic уже предлагает Claude in Chrome для работы в браузере и запланированные задачи для повторяющейся работы. По чистым возможностям ответ да. Агент Claude с этими серверами читает почту, смотрит календарь, заполняет веб-форму и пишет в базу данных. Разрыв находится вокруг этих вызовов.
Что придётся построить самому?
Пользователи Muse эту часть не видят, а разработчики на Claude не могут её пропустить. Каждый пункт ниже Meta сделала один раз для всех пользователей.
Разрешения и подтверждения
MCP сообщает клиенту, какие инструменты существуют. Он не решает, какие из них агент может вызывать без спроса. Нужен слой политик, ваш собственный Sentinel, который помечает каждый инструмент как чтение, запись или движение денег и в последних двух случаях ждёт человека.
OAuth и хранение учётных данных
Спецификация описывает, как клиент получает токен. Хранить refresh-токены каждого пользователя, шифровать их, обновлять и держать вне контекста модели всё равно придётся вам. Muse хранит пароли и данные карт там, где сам агент их прочитать не может, и ваш стек должен поступать так же.
Память
Контекстное окно это не память. Чтобы агент через неделю помнил, какую работу вы ищете, нужно хранилище (обычно начинают с Postgres и эмбеддингов), правила о том, что сохранять, и страница, где пользователь может это увидеть и удалить.
Фоновые задачи
Запрос в чате заканчивается вместе с ответом. Для «напомни через пять дней» нужны очередь, планировщик, воркеры, которые будят агента с сохранённым состоянием, и повторы на случай, если API не ответил вовремя.
Журнал аудита
Каждый вызов инструмента, его входные данные, результат и тот, кто его одобрил, должны попадать в журнал только для добавления, который пользователь может прочитать. По нему вы отлаживаете агента и отвечаете на вопрос «почему он это отправил?».
Защита от промпт-инъекций
Агент в браузере читает тексты незнакомых людей, и в вакансии могут прятаться инструкции для вашего агента. Считайте содержимое страницы данными, ограничьте инструменты, доступные сразу после чтения недоверенного текста, и держите деньги и сообщения за подтверждением. Чтение дерева доступности и запрет на JavaScript у Muse это ответ Meta на ту же проблему.
Браузерная среда
Для тестов хватит Playwright на ноутбуке. Для реальных пользователей нужны изолированные сессии браузера для каждого человека, серверы для них и живой просмотр, чтобы пользователь мог наблюдать или взять управление. По сути, вы заново строите Muse Secure VM.
Как выглядит полная архитектура?
Claude стоит в центре как планировщик. Рантайм агента крутит цикл: отправляет контекст в Claude, получает вызов инструмента, проверяет его по политике, передаёт через MCP-клиент, записывает в журнал и возвращает результат. MCP-серверы и прямые API выходят во внешний мир. Вокруг цикла находятся память, очередь задач с воркерами и изолированный браузер. Пользователь видит только два экрана: подтверждения и журнал.
Как это выглядит на реальной задаче?
Возьмём запрос, достойный рекламы Muse: «Найди удалённые вакансии React за эту неделю, проверь мой календарь для собеседований, подготовь отклики, сохрани прогресс и напомни работодателям через пять дней».
- Поиск. Claude планирует запросы и вызывает MCP-сервер Playwright, чтобы открыть сайты с вакансиями. Текст страниц помечается как недоверенный. нужны браузерная среда и правила против инъекций
- Отбор. Вакансии сравниваются с вашими сохранёнными предпочтениями, например только удалёнка и минимальная зарплата, из памяти. нужна память
- Время. Сервер Calendar возвращает свободные слоты на две недели вперёд. готово с MCP
- Черновики. Claude пишет сопроводительное письмо под каждую вакансию и сохраняет черновики в Drive. готово с MCP
- Подтверждение. Рантайм показывает вам список и черновики. Ничего не уходит, пока вы не нажмёте «одобрить». нужны разрешения
- Отправка и журнал. Одобренные отклики уходят через браузер или Gmail, а каждое действие пишется в журнал аудита и в таблицу вакансий в Postgres. нужен журнал аудита
- Напоминание. Задача, запланированная на пятый день, будит агента. Он проверяет ответы в Gmail и пишет вежливые напоминания тем, кто промолчал. нужны фоновые задачи
Посмотрите, какие шаги отмечены как готовые. MCP и Sonnet 5.5 закрывают мышление и вызовы. Оставшиеся шаги как раз делают агента безопасным, когда он работает без присмотра.
Где впереди Muse, а где выигрывают Claude + MCP?
| Область | Meta Muse | Claude Sonnet 5.5 + MCP |
|---|---|---|
| Настройка | Вошёл и работаешь | Рантайм строите и размещаете вы |
| Интеграции | Почта, календарь, платежи, покупки, приложения Meta; пока короткий список | Любой сервис с MCP-сервером или API |
| Браузер | Управляемый браузер в VM, дерево доступности, без JavaScript на страницах | Playwright или Claude in Chrome; изоляцию выбираете вы |
| Разрешения | Sentinel: разрешить, запретить или спросить | Слой политик пишете вы |
| Память | Встроенная и проактивная | Хранилище и правила выбираете вы |
| Фоновая работа | Продолжается после закрытия приложения | Ваши очередь, планировщик и воркеры |
| Платежи | Link с одноразовыми картами | Своя платёжная интеграция |
| Выбор модели | Только Muse Spark | Sonnet 5.5, Opus 5.5 или другая модель на тех же серверах |
| Контроль данных | Правила Meta, обучение включено по умолчанию | Ваши серверы и ваши правила хранения |
| Цена | Бесплатно, 20 или 100 долларов в месяц | 2 / 10 долларов за миллион токенов плюс хостинг |
Muse эффективнее для человека, которому нужен результат на этой неделе. Claude с MCP эффективнее для команды, которой нужен агент внутри собственного продукта, со своими правилами работы с данными и подключением к системам, которые Meta никогда не интегрирует.
Настоящая конкуренция идёт между моделями или между инфраструктурами?
Разрыв между моделями сокращается. Sonnet 5.5 отстаёт от Opus 5.5 меньше чем на два пункта в OSWorld и GDPval при более низкой цене, а средние модели всех лабораторий улучшаются каждые несколько месяцев. Выход модели не приносит с собой ни VM, ни агента разрешений, ни хранилища учётных данных, ни планировщика, ни журнала аудита.
Meta построила именно эти части, и поэтому Muse ощущается новым, хотя каждая способность существовала и раньше. Для разработчиков MCP превращает большую часть работы с инструментами в конфигурацию. Остаётся рантайм: то, что позволяет агенту действовать, пока вас нет, и потом доказать, что именно он сделал.
Мне кажется, конкуренция всё больше будет касаться агентной инфраструктуры вокруг модели, а не только самой модели. Открытый вопрос в том, кому эта инфраструктура будет принадлежать. Она может остаться внутри нескольких потребительских приложений, а может собираться из открытых частей вроде MCP любым разработчиком. Кому из них вы доверите свою почту?
Частые вопросы
Может ли Claude Sonnet 5.5 сам ходить по сайтам?
Может управлять браузером, если дать ему браузерный инструмент, например MCP-сервер Playwright или Claude in Chrome. Его результат 80,1% в OSWorld 2.1 измеряет как раз такую работу с компьютером.
MCP только для Claude?
Нет. MCP это открытый стандарт под управлением Agentic AI Foundation при Linux Foundation, и его поддерживают многие ИИ-клиенты и инструменты.
Работает ли Claude в фоне, как Muse?
Через API по умолчанию нет. Фоновое выполнение добавляется очередью и воркерами, либо можно пользоваться запланированными задачами в приложениях Anthropic, где они доступны.
Сколько стоит Meta Muse?
По данным Tech Insider, у Muse есть бесплатный тариф и платные за 20 и 100 долларов в месяц.
Безопасно ли позволять ИИ-агенту отправлять письма от моего имени?
Только с шагом подтверждения. Muse спрашивает перед отправкой письма или покупкой. Если вы строите на Claude и MCP, поставьте такое же подтверждение перед каждым действием записи.
Источники
- Meta Newsroom: Introducing Muse (Sept 8, 2026)
- Tech Insider: Meta Muse launch, pricing tiers
- Edapt: How Meta's personal AI agent works
- MindStudio: Meta Muse explained
- VentureBeat: Claude Sonnet 5.5 launch and benchmarks
- TechCrunch: Anthropic releases Sonnet 5.5
- The Decoder: Sonnet 5.5 nearly matches Opus 5.5
- MCP Blog: MCP joins the Agentic AI Foundation
- Model Context Protocol specification
- Playwright MCP server
- GitHub MCP server
META HAT MUSE GEBAUT.KÖNNEN CLAUDE + MCP DAS SCHON?
Claude Sonnet 5.5 vs. Meta Muse: Macht MCP aus Claude einen vollwertigen KI-Agenten?
Sonnet 5.5 ist heute erschienen, Muse vor drei Wochen. Das eine ist ein Modell, das andere ein fertiges Produkt. In diesem Beitrag zerlege ich Muse in seine Teile und prüfe, wie viel davon sich mit Claude und dem Model Context Protocol nachbauen lässt.
Die wichtigsten Fakten
- Meta hat Muse am 8. September 2026 angekündigt. Es läuft auf einem Modell namens Muse Spark und wird in den USA für iOS, Android, das Web und WhatsApp ausgerollt.
- Laut Tech Insider gibt es einen kostenlosen Tarif und Bezahltarife für 20 und 100 Dollar im Monat.
- Anthropic hat Claude Sonnet 5.5 am 28. September 2026 veröffentlicht, zu 2 Dollar pro Million Eingabe-Tokens und 10 Dollar pro Million Ausgabe-Tokens, also zum Preis von Sonnet 5.
- Sonnet 5.5 erreicht 80,1 % in OSWorld 2.1, einem Benchmark für Computernutzung. Sonnet 5 kam auf 57 %.
- MCP ist ein offenes Protokoll, das Anthropic im November 2024 vorgestellt und im Dezember 2025 an die Agentic AI Foundation der Linux Foundation übergeben hat.
Ist Muse die klügere KI oder nur die besser ausgestattete?
Meta hat Muse als vollwertigen persönlichen KI-Agenten gebaut. Aber wenn Claude Sonnet 5.5 bereits schlussfolgern, Tools nutzen, im Web surfen und sich über MCP mit externen Anwendungen verbinden kann, wie viel an Muse ist dann wirklich neu, und wie viel ist einfach sehr gute Infrastruktur rund um ein KI-Modell?
Muse öffnet einen Browser, füllt Formulare aus, verschickt E-Mails, plant Reisen, kauft ein und arbeitet weiter, nachdem Sie die App geschlossen haben. Meta nennt es einen persönlichen Agenten für alle. Im selben Monat hat Anthropic Sonnet 5.5 veröffentlicht und als schnelleren, günstigeren Arbeitspartner beschrieben, der für eine Aufgabe weniger Tool-Aufrufe braucht.
Die beiden Launches beantworten unterschiedliche Fragen. Muse beantwortet: Was kann ein Agent heute ohne jede Einrichtung für mich tun? Sonnet 5.5 beantwortet: Wie gut ist das Gehirn, das ich in meinen eigenen Agenten stecke? Wer Software entwickelt, landet von der zweiten Frage direkt bei einer dritten: Wenn ich Sonnet 5.5 an MCP-Server für Mail, Kalender, Code und einen Browser anschließe, wie nah komme ich an Muse heran?
Ich baue Web-Apps und KI-Integrationen für Kunden und habe mir beide Launches deshalb Stück für Stück angesehen. Unten wird Muse in seine Teile zerlegt, jedes Teil mit dem abgeglichen, was Claude und MCP bereits bieten, und der Rest landet auf einer Bauliste.
Was ist Claude Sonnet 5.5, und was hat sich geändert?
Claude Sonnet 5.5 ist das mittelgroße Modell von Anthropic, erschienen am 28. September 2026 unter der Modell-ID claude-sonnet-5-5. Es steht in der Modellreihe unter Opus 5.5, liegt bei den meisten Agenten-Benchmarks aber nur ein paar Punkte dahinter und kostet weniger.
Beim Launch ging es vor allem um Effizienz. Laut Anthropic erzeugt Sonnet 5.5 Text etwa 30 % schneller als Sonnet 5 und kann die Kosten einer Aufgabe um bis zu 30 % senken, hauptsächlich weil es weniger Tokens und weniger Tool-Aufrufe verbraucht. Lovable meldete rund ein Drittel weniger Tool-Aufrufe in seinen Builds. Box meldete 2,4-mal schnellere Durchläufe bei 12 % weniger Tokens. The Decoder ergänzt, dass das Modell Tool-Aufrufe besser bündelt als sein Vorgänger, was stark zählt, sobald jeder Aufruf übers Netz an einen MCP-Server geht.
| Benchmark | Sonnet 5.5 | Opus 5.5 | Sonnet 5 |
|---|---|---|---|
| OSWorld 2.1 (Computernutzung) | 80,1 % | 81,8 % | 57 % |
| Terminal-Bench 4.0 (Agentenarbeit im Terminal) | 70,6 % | 66,4 % | 10,3 % |
| GDPval-AA (Wissensarbeit, Elo) | 1844 | 1846 | 1449 |
| CursorBench 4.0 (Programmieren) | 55,5 % | 57,8 % | k. A. |
Zwei weitere Details sind wichtig, wenn Sie einen Agenten darauf bauen wollen. Sonnet 5.5 hat einstellbare Aufwandsstufen, sodass ein Routinecheck im Hintergrund auf niedriger Stufe laufen kann und ein Planungsschritt auf hoher. Außerdem ist es über die Claude API, AWS, Google Cloud und Microsoft Azure verfügbar und kann damit in der Cloud laufen, die Sie ohnehin bezahlen.
Ihr Posteingang gehört nicht zum Lieferumfang von Sonnet 5.5. Das Modell entscheidet, was zu tun ist, und fordert ein Tool an. Etwas anderes muss dieses Tool bereitstellen, den Login verwahren und die Schleife am Laufen halten, wenn das Chatfenster zu ist.
Was ist Meta Muse, und wie funktioniert es?
Muse ist Metas Agent für Endkunden, angekündigt am 8. September 2026 und angetrieben von Muse Spark, das Meta als sein fähigstes Modell für agentische Arbeit in der echten Welt beschreibt. Es läuft in den Apps für iOS und Android, im Web und in WhatsApp. Unterstützung für KI-Brillen ist für später angekündigt.
Das Modell ist nur ein Teil. Metas Ankündigung und die ersten Berichte beschreiben ein Paket, das zusammen ausgeliefert wird:
- Eine eigene virtuelle Maschine pro Nutzer, die Muse Secure VM, mit eigenem Browser und Speicher.
- Ein separater Aufsichtsagent namens Sentinel, der Connector-Anfragen und ausgehende Netzwerkaufrufe mit Ihren Einstellungen abgleicht und sie dann erlaubt, blockiert oder bei Ihnen nachfragt (laut Edapt).
- Freigabeabfragen vor heiklen Aktionen wie dem Senden einer E-Mail oder einem Kauf, dazu ein vollständiges Protokoll aller Aktionen des Agenten.
- Ein Gedächtnis für Ihre Routinen und für Dinge, die Sie einmal erwähnt haben. Muse nutzt es, um von sich aus Aktionen vorzuschlagen.
- Ausführung im Hintergrund. Muse arbeitet nach dem Schließen der App weiter und meldet sich, wenn es eine Entscheidung braucht.
- Zahlungen über Link von Stripe zum Start, Shop Pay und 1Password sind für später angekündigt.
Der Browser verdient einen genaueren Blick. Laut Edapt liest Muse den Barrierefreiheitsbaum einer Seite statt ihres Quellcodes, kann auf Seiten kein JavaScript ausführen und pausiert, wenn Sie übernehmen oder ein gespeichertes Passwort eingesetzt wird. Das ist ein vorsichtiger Ansatz. Auf unordentlichen Websites verliert der Agent etwas Flexibilität, im Gegenzug kann eine bösartige Seite ihn schwerer steuern.
Welche Teile von Muse sind besonders effizient?
Am meisten Zeit spart Muse bei der Einrichtung. Sie schreiben keinen OAuth-Code, wählen keine Datenbank für das Gedächtnis und hosten keinen Browser. Freigaben und Protokoll funktionieren ab der ersten Minute. Bezahlt wird mit Einmal-Kartennummern, die an einen Händler, einen Höchstbetrag und ein kurzes Zeitfenster gebunden sind, was bei einem Einkaufsagenten eine ganze Risikoklasse beseitigt. Für Menschen, die nicht programmieren, ist genau dieses Paket das Produkt.
Die Grenzen kommen aus demselben Paket. Die bisherigen Berichte beschreiben weniger Integrationen, als Agenten-Tools für Entwickler erreichen, verfügbar ist Muse nur für Erwachsene in den USA, und laut Edapt erlebten Betatester Verbindungsabbrüche und mindestens einen Agenten, der über eine eng gefasste Aufgabe hinausging. Außerdem werden Gespräche standardmäßig zum Training künftiger Modelle genutzt, solange Sie das nicht abschalten.
Was vergleichen wir hier eigentlich?
Die meisten Vergleiche "Claude gegen Muse" stellen ein Modell neben ein Produkt. Aufgeschrieben sieht der Vergleich so aus:
Claude Sonnet 5.5 = Intelligenz / Modell
Meta Muse = Modell + Infrastruktur + Tools + Runtime
Sonnet 5.5 konkurriert mit Muse Spark. Muse als Produkt konkurriert mit einem Agenten-Stack, und so einen Stack kann man um Claude herum bauen. Die nützliche Frage lautet, wie viel davon es schon als offene Bausteine gibt. Der größte dieser Bausteine ist MCP.
Können Claude + MCP das, was Muse kann?
Das Model Context Protocol ist ein offener Standard, der KI-Anwendungen mit Tools und Daten verbindet. Ein MCP-Server stellt Tools (Aktionen wie "Termin anlegen"), Ressourcen (Daten wie eine Datei) und Prompts bereit. Ein MCP-Client, ob eine Claude-App oder ein eigener Agent auf der Claude API, verbindet sich mit diesen Servern und lässt das Modell sie aufrufen. Für entfernte Server definiert die Spezifikation einen OAuth-basierten Autorisierungsablauf: Der Nutzer meldet sich selbst beim Dienst an, und der Agent erhält ein begrenztes Token statt eines Passworts.
So lässt sich die Funktionsliste von Muse auf MCP abbilden:
| Muse kann | Claude + MCP nutzt | Was der Agent bekommt |
|---|---|---|
| E-Mails lesen und senden | Gmail-MCP-Server oder Connector | Threads suchen, Entwürfe, Senden mit OAuth-Berechtigungen |
| Kalender verwalten | Google-Calendar-MCP-Server | Freie Zeiten, neue Termine, Änderungen |
| Mit Dateien arbeiten | Google-Drive-MCP-Server | Dokumente und Tabellen suchen, lesen, schreiben |
| Code (kein Muse-Schwerpunkt) | GitHub-MCP-Server | Issues, Pull Requests, Repo-Suche |
| Surfen und Formulare ausfüllen | Playwright-MCP-Server oder Claude in Chrome | Navigieren, klicken, lesen und tippen in einem echten Browser |
| Ihre Daten merken | Postgres-, SQLite- oder Supabase-MCP-Server | Datensätze, die der Agent später abfragt und ändert |
| Im Hintergrund arbeiten | Eine Queue oder ein Scheduler als MCP-Tools | Job einreihen, Status später prüfen |
| Andere Dienste nutzen | Ein kleiner eigener MCP-Server über jeder REST-API | Ihre interne API als eine Handvoll Tools |
Lokale Server anzubinden braucht nur ein paar Zeilen Konfiguration. Das ist das Standardformat mcpServers, das Claude Desktop und viele andere Clients lesen:
{
"mcpServers": {
"browser": { "command": "npx", "args": ["@playwright/mcp@latest"] },
"github": { "command": "docker",
"args": ["run", "-i", "--rm", "-e", "GITHUB_PERSONAL_ACCESS_TOKEN",
"ghcr.io/github/github-mcp-server"] },
"postgres": { "command": "npx",
"args": ["-y", "@modelcontextprotocol/server-postgres",
"postgresql://localhost/agent"] }
}
}
Gmail, Google Calendar und Drive gibt es in den Claude-Apps als fertige Connectoren, und Anthropic liefert bereits Claude in Chrome zum Surfen sowie geplante Aufgaben für wiederkehrende Arbeit. Bei den reinen Fähigkeiten lautet die Antwort also ja. Ein Claude-Agent mit diesen Servern liest Ihr Postfach, prüft Ihren Kalender, füllt ein Webformular aus und schreibt in eine Datenbank. Die Lücke liegt rund um diese Aufrufe.
Was müssten Sie noch selbst bauen?
Muse-Nutzer sehen diesen Teil nie, und wer mit Claude entwickelt, kann ihn nicht überspringen. Jeder Punkt unten ist etwas, das Meta einmal für alle Nutzer gebaut hat.
Berechtigungen und Freigaben
MCP sagt dem Client, welche Tools es gibt. Es entscheidet nicht, welche der Agent ohne Rückfrage aufrufen darf. Sie brauchen eine Richtlinienschicht, Ihren eigenen Sentinel, der jedes Tool als Lesen, Schreiben oder Geldbewegung einstuft und bei den letzten beiden auf einen Menschen wartet.
OAuth und Speicherung von Zugangsdaten
Die Spezifikation legt fest, wie ein Client ein Token bekommt. Refresh-Tokens pro Nutzer zu speichern, zu verschlüsseln, zu rotieren und aus dem Kontext des Modells herauszuhalten, bleibt Ihre Aufgabe. Muse bewahrt Passwörter und Kartendaten dort auf, wo der Agent selbst sie nicht lesen kann, und Ihr Stack sollte es genauso machen.
Gedächtnis
Ein Kontextfenster ist kein Gedächtnis. Damit der Agent nächste Woche noch weiß, welche Stelle Sie suchen, brauchen Sie einen Speicher (Postgres mit Embeddings ist ein üblicher Anfang), Regeln dafür, was gespeichert wird, und eine Seite, auf der Nutzer das einsehen und löschen können.
Hintergrundjobs
Eine Chat-Anfrage endet mit der Antwort. "Hake in fünf Tagen nach" braucht eine Queue, einen Scheduler, Worker, die den Agenten mit gespeichertem Zustand wecken, und Wiederholungen, wenn eine API zu lange braucht.
Audit-Protokolle
Jeder Tool-Aufruf, seine Eingabe, sein Ergebnis und die Person, die ihn freigegeben hat, gehören in ein Protokoll, an das nur angehängt wird und das der Nutzer lesen kann. Damit debuggen Sie den Agenten und beantworten die Frage "Warum hat er das geschickt?".
Schutz vor Prompt-Injection
Ein surfender Agent liest Texte von Fremden, und eine Stellenanzeige kann Anweisungen an Ihren Agenten verstecken. Behandeln Sie Seiteninhalte als Daten, beschränken Sie die Tools, die direkt nach dem Lesen nicht vertrauenswürdiger Inhalte laufen dürfen, und halten Sie Geld und Nachrichten hinter einer Freigabe. Das Lesen über den Barrierefreiheitsbaum und die Regel gegen JavaScript sind Metas Antwort auf genau dieses Problem.
Eine Browser-Umgebung
Für Tests reicht Playwright auf dem Laptop. Für echte Nutzer brauchen Sie isolierte Browser-Sitzungen pro Person, Server, auf denen sie laufen, und eine Live-Ansicht, damit Nutzer zusehen oder übernehmen können. Sie bauen also die Muse Secure VM nach.
Wie sieht die vollständige Architektur aus?
Claude sitzt als Planer in der Mitte. Die Agenten-Runtime betreibt die Schleife: Sie schickt den Kontext an Claude, empfängt einen Tool-Aufruf, prüft ihn gegen die Richtlinie, leitet ihn über den MCP-Client weiter, protokolliert ihn und gibt das Ergebnis zurück. MCP-Server und direkte APIs reichen in die Außenwelt. Gedächtnis, eine Job-Queue mit Workern und ein isolierter Browser umgeben die Schleife. Nutzer sehen nur zwei Bildschirme: Freigaben und Protokoll.
Wie sieht das bei einer echten Aufgabe aus?
Nehmen wir eine Anfrage, die aus einer Muse-Werbung stammen könnte: "Finde Remote-Jobs mit React aus dieser Woche, prüfe meinen Kalender für Vorstellungsgespräche, bereite die Bewerbungen vor, speichere meinen Fortschritt und hake in fünf Tagen nach."
- Suchen. Claude plant die Suchanfragen und ruft den Playwright-MCP-Server auf, um Jobbörsen zu öffnen. Seitentext wird als nicht vertrauenswürdig markiert. braucht Browser-Umgebung und Injection-Regeln
- Filtern. Die Anzeigen werden mit Ihren gespeicherten Vorlieben verglichen, etwa nur remote und ein Mindestgehalt, geladen aus dem Gedächtnis. braucht Gedächtnis
- Zeit prüfen. Der Calendar-Server liefert freie Termine für die nächsten zwei Wochen. fertig mit MCP
- Entwerfen. Claude schreibt für jede Stelle ein passendes Anschreiben und speichert die Entwürfe in Drive. fertig mit MCP
- Freigeben. Die Runtime zeigt Ihnen die Auswahl und die Entwürfe. Nichts geht raus, bevor Sie auf Freigeben tippen. braucht Berechtigungen
- Absenden und protokollieren. Freigegebene Bewerbungen gehen über den Browser oder Gmail raus, und jede Aktion wird ins Audit-Protokoll und in eine Jobs-Tabelle in Postgres geschrieben. braucht Audit-Protokoll
- Nachhaken. Ein für Tag fünf geplanter Job weckt den Agenten. Er prüft Gmail auf Antworten und entwirft höfliche Nachfragen für die Firmen, die sich nicht gemeldet haben. braucht Hintergrundjobs
Achten Sie darauf, welche Schritte als fertig markiert sind. MCP und Sonnet 5.5 decken das Denken und die Aufrufe ab. Die offenen Schritte sind genau die, die einen Agenten sicher genug machen, um ihn allein arbeiten zu lassen.
Wo liegt Muse vorn, und wo gewinnen Claude + MCP?
| Bereich | Meta Muse | Claude Sonnet 5.5 + MCP |
|---|---|---|
| Einrichtung | Anmelden und loslegen | Sie bauen und hosten die Runtime |
| Integrationen | E-Mail, Kalender, Zahlungen, Shopping, Meta-Apps; bisher eine kürzere Liste | Jeder Dienst mit MCP-Server oder API |
| Browser | Verwalteter VM-Browser, Barrierefreiheitsbaum, kein Seiten-JavaScript | Playwright oder Claude in Chrome; Isolation nach Wahl |
| Berechtigungen | Sentinel: erlauben, ablehnen oder nachfragen | Sie schreiben die Richtlinienschicht |
| Gedächtnis | Eingebaut und proaktiv | Speicher und Regeln wählen Sie |
| Hintergrundarbeit | Läuft nach dem Schließen der App weiter | Ihre Queue, Ihr Scheduler, Ihre Worker |
| Zahlungen | Link mit Einmal-Karten | Ihre eigene Zahlungsintegration |
| Modellwahl | Nur Muse Spark | Sonnet 5.5, Opus 5.5 oder ein anderes Modell mit denselben Servern |
| Datenkontrolle | Metas Richtlinien, Training standardmäßig an | Ihre Server und Ihre Aufbewahrungsregeln |
| Preis | Kostenlos, 20 oder 100 Dollar im Monat | 2 / 10 Dollar pro Million Tokens plus Hosting |
Muse ist die effiziente Wahl für jemanden, der diese Woche Ergebnisse will. Claude mit MCP ist die effiziente Wahl für ein Team, das einen Agenten im eigenen Produkt braucht, mit eigenen Datenregeln und angebunden an Systeme, die Meta nie integrieren wird.
Findet der eigentliche Wettbewerb beim Modell oder bei der Infrastruktur statt?
Der Abstand zwischen den Modellen schrumpft. Sonnet 5.5 liegt bei OSWorld und GDPval weniger als zwei Punkte hinter Opus 5.5 und ist günstiger, und die mittelgroßen Modelle aller Labore werden alle paar Monate besser. Ein neues Modell bringt keine VM, keinen Berechtigungsagenten, keinen Zugangsdaten-Tresor, keinen Scheduler und kein Audit-Protokoll mit.
Genau diese Teile hat Meta gebaut, und deshalb wirkt Muse neu, obwohl es jede einzelne Fähigkeit schon gab. Für Entwickler macht MCP den größten Teil der Tool-Seite zu Konfiguration. Übrig bleibt die Runtime: die Teile, die einen Agenten handeln lassen, während Sie weg sind, und die hinterher belegen, was er getan hat.
Meine Einschätzung: Der Wettbewerb dreht sich zunehmend um die Agenten-Infrastruktur rund um das Modell und nicht nur um das Modell selbst. Offen ist, wem diese Infrastruktur gehört. Sie kann in einigen wenigen Consumer-Apps landen oder von jedem Entwickler aus offenen Bausteinen wie MCP zusammengesetzt werden. Welcher der beiden Varianten würden Sie Ihr Postfach anvertrauen?
Häufige Fragen
Kann Claude Sonnet 5.5 selbstständig im Web surfen?
Es kann einen Browser steuern, sobald Sie ihm ein Browser-Tool geben, etwa den Playwright-MCP-Server oder Claude in Chrome. Sein Ergebnis von 80,1 % in OSWorld 2.1 misst genau diese Art der Computernutzung.
Ist MCP nur für Claude?
Nein. MCP ist ein offener Standard unter dem Dach der Agentic AI Foundation der Linux Foundation, und viele KI-Clients und Tools unterstützen ihn.
Arbeitet Claude wie Muse im Hintergrund weiter?
Über die API standardmäßig nicht. Hintergrundausführung ergänzen Sie mit einer Queue und Workern, oder Sie nutzen geplante Aufgaben in den Apps von Anthropic, wo sie verfügbar sind.
Was kostet Meta Muse?
Laut dem Launch-Bericht von Tech Insider gibt es einen kostenlosen Tarif und Bezahltarife für 20 und 100 Dollar im Monat.
Ist es sicher, einen KI-Agenten E-Mails in meinem Namen senden zu lassen?
Nur mit einem Freigabeschritt. Muse fragt nach, bevor es E-Mails sendet oder etwas kauft. Wenn Sie mit Claude und MCP bauen, setzen Sie dieselbe Freigabe vor jede schreibende Aktion.
Quellen
- Meta Newsroom: Introducing Muse (Sept 8, 2026)
- Tech Insider: Meta Muse launch, pricing tiers
- Edapt: How Meta's personal AI agent works
- MindStudio: Meta Muse explained
- VentureBeat: Claude Sonnet 5.5 launch and benchmarks
- TechCrunch: Anthropic releases Sonnet 5.5
- The Decoder: Sonnet 5.5 nearly matches Opus 5.5
- MCP Blog: MCP joins the Agentic AI Foundation
- Model Context Protocol specification
- Playwright MCP server
- GitHub MCP server
META A CRÉÉ MUSE.CLAUDE + MCP SAVENT-ILS DÉJÀ LE FAIRE ?
Claude Sonnet 5.5 vs Meta Muse : MCP peut-il faire de Claude un véritable agent IA ?
Sonnet 5.5 est sorti aujourd'hui, Muse il y a trois semaines. L'un est un modèle, l'autre un produit fini. Cet article démonte Muse pièce par pièce pour voir ce qu'on peut reconstruire avec Claude et le Model Context Protocol.
Faits clés
- Meta a annoncé Muse le 8 septembre 2026. Il tourne sur un modèle appelé Muse Spark et se déploie aux États-Unis sur iOS, Android, le web et WhatsApp.
- Muse propose une formule gratuite et des formules payantes à 20 et 100 dollars par mois, selon Tech Insider.
- Anthropic a lancé Claude Sonnet 5.5 le 28 septembre 2026 à 2 dollars le million de tokens en entrée et 10 dollars le million en sortie, soit le prix de Sonnet 5.
- Sonnet 5.5 obtient 80,1 % sur OSWorld 2.1, un benchmark d'utilisation d'ordinateur. Sonnet 5 obtenait 57 %.
- MCP est un protocole ouvert qu'Anthropic a présenté en novembre 2024 puis confié à l'Agentic AI Foundation de la Linux Foundation en décembre 2025.
Muse est-il une IA plus intelligente, ou simplement mieux équipée ?
Meta a conçu Muse comme un agent IA personnel complet. Mais si Claude Sonnet 5.5 sait déjà raisonner, utiliser des outils, naviguer sur le web et se connecter à des applications externes via MCP, quelle part de Muse est vraiment nouvelle, et quelle part n'est qu'une excellente infrastructure autour d'un modèle d'IA ?
Muse ouvre un navigateur, remplit des formulaires, envoie des e-mails, organise un voyage, fait des achats et continue de travailler après la fermeture de l'application. Meta le présente comme un agent personnel pour tout le monde. Le même mois, Anthropic a sorti Sonnet 5.5 en le décrivant comme un partenaire de travail plus rapide et moins cher, qui a besoin de moins d'appels d'outils pour finir une tâche.
Ces deux lancements répondent à des questions différentes. Muse répond à « que peut faire un agent pour moi aujourd'hui, sans rien configurer ? ». Sonnet 5.5 répond à « quelle est la qualité du cerveau que je branche dans mon propre agent ? ». Quand on écrit du code, la deuxième question mène tout droit à une troisième : si je connecte Sonnet 5.5 à des serveurs MCP pour ma messagerie, mon agenda, mon code et un navigateur, à quel point je m'approche de Muse ?
Je développe des applications web et des intégrations IA pour des clients, alors j'ai passé les deux lancements au crible. Plus bas, Muse est découpé en composants, chaque composant est comparé à ce que Claude et MCP offrent déjà, et le reste va sur une liste de choses à construire.
Qu'est-ce que Claude Sonnet 5.5, et qu'est-ce qui a changé ?
Claude Sonnet 5.5 est le modèle de taille moyenne d'Anthropic, sorti le 28 septembre 2026 sous l'identifiant claude-sonnet-5-5. Il se place sous Opus 5.5 dans la gamme, mais sur la plupart des benchmarks d'agents il reste à quelques points de lui, pour un prix plus bas.
Le lancement portait surtout sur l'efficacité. Selon Anthropic, Sonnet 5.5 génère du texte environ 30 % plus vite que Sonnet 5 et peut réduire le coût d'une tâche jusqu'à 30 %, surtout parce qu'il consomme moins de tokens et fait moins d'appels d'outils. Lovable a constaté environ un tiers d'appels en moins dans ses builds. Box a mesuré des exécutions 2,4 fois plus rapides avec 12 % de tokens en moins. The Decoder ajoute que le modèle regroupe mieux ses appels d'outils que son prédécesseur, ce qui compte beaucoup quand chaque appel part sur le réseau vers un serveur MCP.
| Benchmark | Sonnet 5.5 | Opus 5.5 | Sonnet 5 |
|---|---|---|---|
| OSWorld 2.1 (utilisation d'ordinateur) | 80,1 % | 81,8 % | 57 % |
| Terminal-Bench 4.0 (travail d'agent en terminal) | 70,6 % | 66,4 % | 10,3 % |
| GDPval-AA (travail intellectuel, Elo) | 1844 | 1846 | 1449 |
| CursorBench 4.0 (code) | 55,5 % | 57,8 % | n.d. |
Deux autres détails comptent si vous voulez bâtir un agent dessus. Sonnet 5.5 dispose de niveaux d'effort réglables : une vérification de routine en arrière-plan peut tourner en effort bas et une étape de planification en effort élevé. Il est aussi disponible via l'API Claude, AWS, Google Cloud et Microsoft Azure, donc il peut vivre dans le cloud que vous payez déjà.
Votre boîte mail n'est pas livrée avec Sonnet 5.5. Le modèle décide quoi faire et demande un outil. Une autre brique doit fournir cet outil, garder la connexion et faire tourner la boucle une fois la fenêtre de chat fermée.
Qu'est-ce que Meta Muse, et comment fonctionne-t-il ?
Muse est l'agent grand public de Meta, annoncé le 8 septembre 2026 et propulsé par Muse Spark, que Meta décrit comme son modèle le plus capable pour le travail agentique concret. On l'utilise dans les applis iOS et Android, sur le web et dans WhatsApp. La prise en charge des lunettes IA est annoncée pour plus tard.
Le modèle n'est qu'une pièce. L'annonce de Meta et les premiers articles décrivent un ensemble livré d'un bloc :
- Une machine virtuelle dédiée par utilisateur, la Muse Secure VM, avec son propre navigateur et son stockage.
- Un agent de surveillance séparé, Sentinel, qui confronte les requêtes vers les connecteurs et les appels réseau sortants à vos réglages, puis les autorise, les bloque ou vous demande (selon Edapt).
- Des demandes d'approbation avant les actions sensibles, comme envoyer un e-mail ou payer, et un historique complet de tout ce que l'agent a fait.
- Une mémoire de vos habitudes et des choses mentionnées une seule fois, que Muse utilise pour proposer des actions de lui-même.
- Une exécution en arrière-plan. Muse continue après la fermeture de l'appli et revient quand il a besoin d'une décision.
- Des paiements via Link de Stripe au lancement, avec Shop Pay et 1Password annoncés pour plus tard.
Le navigateur mérite qu'on s'y arrête. D'après Edapt, Muse lit l'arbre d'accessibilité de la page plutôt que son code, ne peut pas exécuter de JavaScript dans les pages et se met en pause quand vous prenez la main ou quand un identifiant enregistré est saisi. C'est un choix prudent. L'agent perd un peu de souplesse sur les sites mal fichus, et en échange une page malveillante a plus de mal à le manipuler.
Quelles parties de Muse sont les plus efficaces ?
C'est sur la configuration que Muse fait gagner le plus de temps. Pas de code OAuth à écrire, pas de base de données à choisir pour la mémoire, pas de navigateur à héberger. Les approbations et le journal fonctionnent dès la première minute. Les paiements passent par des numéros de carte à usage unique, liés à un marchand, plafonnés et valables peu de temps, ce qui supprime toute une catégorie de risques pour un agent d'achat. Pour quelqu'un qui ne code pas, ce paquet est le produit entier.
Les limites viennent du même paquet. Les articles parus décrivent moins d'intégrations que ce qu'atteignent les outils d'agents pour développeurs, le service est réservé aux adultes aux États-Unis, et selon Edapt des bêta-testeurs ont connu des déconnexions et au moins un agent qui a débordé d'une tâche précise. Les conversations servent aussi par défaut à entraîner les futurs modèles, sauf si vous le désactivez.
Alors, que compare-t-on vraiment ?
La plupart des comparatifs « Claude contre Muse » mettent un modèle face à un produit. Une fois écrit, cela donne :
Claude Sonnet 5.5 = intelligence / modèle
Meta Muse = modèle + infrastructure + outils + runtime
Sonnet 5.5 est en concurrence avec Muse Spark. Muse en tant que produit est en concurrence avec une pile d'agent, et on peut en assembler une autour de Claude. La vraie question utile est la part de cette pile qui existe déjà sous forme de briques ouvertes. MCP est la plus grosse d'entre elles.
Claude + MCP peuvent-ils faire ce que fait Muse ?
Le Model Context Protocol est un standard ouvert pour relier des applications d'IA à des outils et des données. Un serveur MCP expose des outils (des actions comme « créer un événement »), des ressources (des données comme un fichier) et des prompts. Un client MCP, qu'il s'agisse d'une appli Claude ou de votre propre agent sur l'API Claude, se connecte à ces serveurs et laisse le modèle les appeler. Pour les serveurs distants, la spécification définit une autorisation basée sur OAuth : l'utilisateur se connecte lui-même au service et l'agent reçoit un jeton limité au lieu d'un mot de passe.
Voici comment la liste de fonctions de Muse se transpose sur MCP :
| Muse sait | Claude + MCP utilise | Ce que l'agent obtient |
|---|---|---|
| Lire et envoyer des e-mails | Serveur MCP ou connecteur Gmail | Recherche de fils, brouillons, envoi avec droits OAuth |
| Gérer votre agenda | Serveur MCP Google Calendar | Créneaux libres, nouveaux événements, modifications |
| Travailler sur des fichiers | Serveur MCP Google Drive | Chercher, lire et écrire documents et tableurs |
| Code (pas une priorité de Muse) | Serveur MCP GitHub | Issues, pull requests, recherche dans les dépôts |
| Naviguer et remplir des formulaires | Serveur MCP Playwright ou Claude in Chrome | Naviguer, cliquer, lire et taper dans un vrai navigateur |
| Retenir vos données | Serveur MCP Postgres, SQLite ou Supabase | Des lignes que l'agent interroge et met à jour plus tard |
| Travailler en arrière-plan | Une file ou un planificateur exposé en outils MCP | Mettre une tâche en file, vérifier son état ensuite |
| Utiliser d'autres services | Un petit serveur MCP maison sur n'importe quelle API REST | Votre API interne sous forme de quelques outils |
Brancher des serveurs locaux tient en quelques lignes de configuration. Voici le format standard mcpServers que lisent Claude Desktop et bien d'autres clients :
{
"mcpServers": {
"browser": { "command": "npx", "args": ["@playwright/mcp@latest"] },
"github": { "command": "docker",
"args": ["run", "-i", "--rm", "-e", "GITHUB_PERSONAL_ACCESS_TOKEN",
"ghcr.io/github/github-mcp-server"] },
"postgres": { "command": "npx",
"args": ["-y", "@modelcontextprotocol/server-postgres",
"postgresql://localhost/agent"] }
}
}
Gmail, Google Calendar et Drive existent déjà comme connecteurs prêts à l'emploi dans les applis Claude, et Anthropic fournit Claude in Chrome pour la navigation et des tâches planifiées pour le travail récurrent. Sur les capacités brutes, la réponse est donc oui. Un agent Claude équipé de ces serveurs lit votre boîte mail, consulte votre agenda, remplit un formulaire web et écrit dans une base de données. Le manque se trouve autour de ces appels.
Que resterait-il à construire vous-même ?
Les utilisateurs de Muse ne voient jamais cette partie, et ceux qui développent avec Claude ne peuvent pas l'éviter. Chaque point ci-dessous est quelque chose que Meta a construit une fois pour tous ses utilisateurs.
Permissions et approbations
MCP indique au client quels outils existent. Il ne décide pas lesquels l'agent peut appeler sans demander. Il vous faut une couche de règles, votre propre Sentinel, qui classe chaque outil en lecture, écriture ou mouvement d'argent et attend un humain pour les deux derniers.
OAuth et stockage des identifiants
La spécification définit comment un client obtient un jeton. Stocker les refresh tokens de chaque utilisateur, les chiffrer, les renouveler et les garder hors du contexte du modèle reste votre travail. Muse range mots de passe et cartes là où l'agent lui-même ne peut pas les lire, et votre pile devrait faire pareil.
Mémoire
Une fenêtre de contexte n'est pas une mémoire. Pour qu'un agent se souvienne la semaine prochaine du poste que vous cherchez, il faut un stockage (Postgres avec des embeddings est un début courant), des règles sur ce qu'on enregistre et une page où l'utilisateur peut le consulter et l'effacer.
Tâches en arrière-plan
Une requête de chat s'arrête avec la réponse. « Relance dans cinq jours » demande une file, un planificateur, des workers qui réveillent l'agent avec son état enregistré, et des nouvelles tentatives quand une API met trop de temps.
Journaux d'audit
Chaque appel d'outil, son entrée, son résultat et la personne qui l'a approuvé doivent aller dans un journal en ajout seul, lisible par l'utilisateur. C'est avec lui qu'on débogue l'agent et qu'on répond à « pourquoi a-t-il envoyé ça ? ».
Sécurité contre l'injection de prompt
Un agent qui navigue lit des textes écrits par des inconnus, et une offre d'emploi peut cacher des instructions destinées à votre agent. Traitez le contenu des pages comme des données, limitez les outils utilisables juste après la lecture d'un contenu non fiable, et gardez l'argent et les messages derrière une approbation. La lecture par arbre d'accessibilité et l'interdiction du JavaScript sont la réponse de Meta à ce même problème.
Un environnement de navigation
Playwright sur votre portable suffit pour tester. Pour de vrais utilisateurs, il faut des sessions de navigateur isolées par personne, des serveurs pour les faire tourner et une vue en direct pour que l'utilisateur regarde ou reprenne la main. Autrement dit, vous reconstruisez la Muse Secure VM.
À quoi ressemble l'architecture complète ?
Claude est au centre, dans le rôle du planificateur. Le runtime de l'agent fait tourner la boucle : il envoie le contexte à Claude, reçoit un appel d'outil, le vérifie contre les règles, le transmet via le client MCP, le journalise et renvoie le résultat. Les serveurs MCP et les API directes touchent le monde extérieur. La mémoire, une file de tâches avec ses workers et un navigateur isolé entourent la boucle. L'utilisateur ne voit que deux écrans : les approbations et le journal.
À quoi cela ressemble-t-il sur une vraie tâche ?
Prenons une demande digne d'une pub Muse : « Trouve des offres React en télétravail publiées cette semaine, regarde mon agenda pour les entretiens, prépare les candidatures, enregistre ma progression et relance dans cinq jours. »
- Chercher. Claude prépare les requêtes et appelle le serveur MCP Playwright pour ouvrir des sites d'emploi. Le texte des pages est marqué comme non fiable. demande un environnement de navigation et des règles anti-injection
- Filtrer. Les offres sont comparées à vos préférences enregistrées, comme télétravail uniquement et salaire minimum, chargées depuis la mémoire. demande une mémoire
- Vérifier l'agenda. Le serveur Calendar renvoie les créneaux libres des deux prochaines semaines. prêt avec MCP
- Rédiger. Claude écrit une lettre de motivation adaptée à chaque offre et enregistre les brouillons dans Drive. prêt avec MCP
- Approuver. Le runtime vous montre la sélection et les brouillons. Rien ne part tant que vous n'avez pas approuvé. demande des permissions
- Envoyer et journaliser. Les candidatures approuvées partent par le navigateur ou Gmail, et chaque action est écrite dans le journal d'audit et dans une table d'offres Postgres. demande un journal d'audit
- Relancer. Une tâche prévue au cinquième jour réveille l'agent. Il vérifie les réponses dans Gmail et rédige des relances polies pour les entreprises restées muettes. demande des tâches en arrière-plan
Regardez quelles étapes sont marquées prêtes. MCP et Sonnet 5.5 couvrent la réflexion et les appels. Les étapes restantes sont justement celles qui permettent de laisser un agent travailler seul sans risque.
Où Muse a-t-il de l'avance, et où Claude + MCP l'emportent-ils ?
| Domaine | Meta Muse | Claude Sonnet 5.5 + MCP |
|---|---|---|
| Mise en route | On se connecte et c'est parti | Vous construisez et hébergez le runtime |
| Intégrations | E-mail, agenda, paiements, achats, applis Meta ; liste encore courte | Tout service doté d'un serveur MCP ou d'une API |
| Navigateur | Navigateur en VM gérée, arbre d'accessibilité, pas de JavaScript de page | Playwright ou Claude in Chrome ; isolation à votre choix |
| Permissions | Sentinel : autoriser, refuser ou demander | Vous écrivez la couche de règles |
| Mémoire | Intégrée et proactive | Vous choisissez le stockage et les règles |
| Travail en arrière-plan | Continue après la fermeture de l'appli | Votre file, votre planificateur, vos workers |
| Paiements | Link avec cartes à usage unique | Votre propre intégration de paiement |
| Choix du modèle | Muse Spark uniquement | Sonnet 5.5, Opus 5.5 ou un autre modèle sur les mêmes serveurs |
| Contrôle des données | Règles de Meta, entraînement activé par défaut | Vos serveurs et vos règles de conservation |
| Prix | Gratuit, 20 ou 100 dollars par mois | 2 / 10 dollars par million de tokens, plus l'hébergement |
Muse est le choix efficace pour quelqu'un qui veut des résultats cette semaine. Claude avec MCP est le choix efficace pour une équipe qui a besoin d'un agent dans son propre produit, avec ses propres règles de données et relié à des systèmes que Meta n'intégrera jamais.
La vraie compétition se joue-t-elle sur le modèle ou sur l'infrastructure ?
L'écart entre modèles se resserre. Sonnet 5.5 est à moins de deux points d'Opus 5.5 sur OSWorld et GDPval pour un prix plus bas, et les modèles intermédiaires de tous les laboratoires progressent tous les quelques mois. Une sortie de modèle n'apporte ni VM, ni agent de permissions, ni coffre d'identifiants, ni planificateur, ni journal d'audit.
Meta a construit précisément ces pièces, et c'est pour cela que Muse paraît nouveau alors que chaque capacité existait déjà. Pour les développeurs, MCP transforme l'essentiel du côté outils en configuration. Il reste le runtime : ce qui permet à un agent d'agir pendant votre absence et de prouver ensuite ce qu'il a fait.
À mon avis, la compétition portera de plus en plus sur l'infrastructure d'agents autour du modèle, et pas seulement sur le modèle lui-même. La question ouverte est de savoir à qui appartiendra cette infrastructure. Elle peut rester enfermée dans quelques applis grand public, ou être assemblée par n'importe quel développeur à partir de briques ouvertes comme MCP. À laquelle des deux confieriez-vous votre boîte mail ?
Questions fréquentes
Claude Sonnet 5.5 peut-il naviguer seul sur le web ?
Il peut piloter un navigateur dès qu'on lui donne un outil de navigation, par exemple le serveur MCP Playwright ou Claude in Chrome. Son score de 80,1 % sur OSWorld 2.1 mesure justement ce type d'utilisation d'ordinateur.
MCP est-il réservé à Claude ?
Non. MCP est un standard ouvert hébergé par l'Agentic AI Foundation au sein de la Linux Foundation, et beaucoup de clients et d'outils d'IA le prennent en charge.
Claude continue-t-il à travailler en arrière-plan comme Muse ?
Pas par défaut via l'API. On ajoute l'exécution en arrière-plan avec une file et des workers, ou on utilise les tâches planifiées des applis d'Anthropic là où elles existent.
Combien coûte Meta Muse ?
Muse propose une formule gratuite et des formules payantes à 20 et 100 dollars par mois, selon la couverture du lancement par Tech Insider.
Est-il prudent de laisser un agent IA envoyer des e-mails à ma place ?
Seulement avec une étape d'approbation. Muse demande avant d'envoyer un e-mail ou d'acheter quoi que ce soit. Si vous construisez avec Claude et MCP, placez la même approbation devant chaque action d'écriture.
Sources
- Meta Newsroom: Introducing Muse (Sept 8, 2026)
- Tech Insider: Meta Muse launch, pricing tiers
- Edapt: How Meta's personal AI agent works
- MindStudio: Meta Muse explained
- VentureBeat: Claude Sonnet 5.5 launch and benchmarks
- TechCrunch: Anthropic releases Sonnet 5.5
- The Decoder: Sonnet 5.5 nearly matches Opus 5.5
- MCP Blog: MCP joins the Agentic AI Foundation
- Model Context Protocol specification
- Playwright MCP server
- GitHub MCP server

Comments
Post a Comment