A hét két látszólag különálló eseménye ugyanarra a tézisre fut ki. Március 6-án a kínai Butterfly Effect (Monica.im) startup kiadja a Manus AI nevű “általános AI-agentet”, ami hétvége alatt vírusként terjed — a sajtó “Kínai DeepSeek-pillanat agentekre” framingben kommunikálja. Hétfőn azonban kiderül, hogy Manus motorja a Claude 3.5 Sonnet plus 30 tool — nem új modell, hanem ügyes orchestration. Másnap, március 11-én az OpenAI kiadja a Responses API-t, az Agents SDK-t és három beépített tool-t — a Manus-mintát intézményesítve. Plus március 10-én külön kutatási anyagot is publikál arról, miért nem szabad a Chain-of-Thought-tokeneket RL-lel optimalizálni — és arXiv-paperben mutatja meg, hogy egy gyengébb modell (GPT-4o) hatékonyan monitorozza egy erősebb (o3-mini) reasoning-modell viselkedését. A két szál összeolvadása: 2025-ben az agent-stack mérnöki képe már nem “új modell érkezik”, hanem meglévő modell + jól tervezett tool-réteg + verifier / CoT-monitor. Plus Google natív image-generation-t ad a Gemini 2.0 Flash-be, Husain és Shankar evals-kurzust indít, és a Glean (Arvind Jain) elmondja, hogyan ért el $100M ARR-t agent-platformra építve.
Manus AI — a Claude-wrapper, ami megnyerte a hétvégét
A Manus AI március 6-i release-videójával robbant be: 26 social-fiók egyidejű kezelése, 75 oldalas szakcikk-szintű kutatás, deep-research-összevethető eredmények. Vasárnapra kiderült, hogy Manus alatt Claude 3.5 Sonnet + ~30 tool dolgozik, plus Qwen-fine-tune-jaival. Nate B Jones március 10-i videójában ezt nem csalódásként, hanem a 2025-ös trendet keretezi: “we have reached the point in the AI revolution where if someone tells you ‘I’m using existing intelligence but I gave it new tools’, I’m not surprised.”
Két dolgot mond ki: (1) a meglévő Frontier-intelligencia sok use-case-re már elég jó — a hiányzó réteg a tool-szerződés, a memória és az iteratív loop. (2) A “wrapper” lekicsinylő szó nem helytálló — egy 30-tool stack mérnöki tartalma (eszközválasztás, tool-leírás-finomhangolás, error-recovery, párhuzamosság) annyi, hogy enterprise-csapat hónapokig építi.
A SET-szempont: a tool-szerződés mint elsőrendű mérnöki artefactum már a W07-es Anthropic-iránymutatásban is megjelent — Manus a prakszis-példa. Ha 30 tool-lal egy Sonnet deep-research-szintű kimenetet hoz, akkor egy belső auditra vagy kontrolling-feladatra 8-10 jól tervezett tool is elegendő.
OpenAI március 11. — Responses API, Agents SDK, három beépített tool
Másnap az OpenAI hivatalos bejelentésében kiadja a 2025-ös agent-platformját. A Latent Space fejlesztői interjújában Roman Huet (DevRel) és Nikunj Handa (API platform) ismertetik:
- Responses API — a chat-completions és az assistants egyesítése; stateful módban 30 napig ingyen tárolja a beszélgetés-történetet. “An API for the internet” — tools, structured outputs, function-calling egyetlen hívásban. Ez API-szintű mirror-ja a W07-es “we hate the model picker”-üzenetnek.
- Web search tool — külön fine-tune (
gpt-4o-search-preview), 90% pontosság a SimpleQA benchmarken (base GPT-4o 38% — a tool-stack több mint duplájára emeli a faktualitást), citations-szel. Structured output-ba pumpálható egyetlen hívásban. - File search tool — managed RAG metadata-filtering-gel. Kis-közepes use-case-ekre nincs többé érv saját Pinecone / Qdrant-deploymentre.
- Computer use tool — Operator-modell fejlesztőknek; screenshot in, action out. Roman: “this is the GPT-1 of computer use right now” — enterprise-deployra korai.
- Agents SDK — a Swarm-projekt utódja, Python-csomag. Két kulcsfogalom: handoff (kontroll-átadás agentek között) és guardrail (parallel optimistic generation, amit validátor leblokkolhat). Built-in tracing, és — stratégiailag fontos — bármilyen chat-completions-kompatibilis modellel működik (Anthropic, Mistral, DeepSeek, Llama, Qwen). Az OpenAI az orchestration-rétegen próbál megfogódzni, nem csak a modellen.
Nate B Jones március 12-i értékelésében hűti a hype-ot: szerinte ez defenzív lépés az MCP-ökoszisztéma sikere ellen. A fejlesztő-mindshare a Claude+MCP+LangGraph stackbe folyik. Nate: “beyond the underlying model, is there a differentiator in the way they’ve set up the ecosystem?” — válasza: nem látható. A Claude-MCP nyílt protokoll, a LangGraph nyílt forrás; az OpenAI-stack provider-lock-in marad.
Chain-of-Thought monitor — a verifier-réteg új neve
Március 10-én az OpenAI kiad egy arXiv-papert (2503.11926) “Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation” címmel. Nate B Jones március 11-én ismerteti. Négy állítás:
- A reasoning-modellek Chain-of-Thought-tokenjeit nem szabad RL-lel optimalizálni, csak az output-tokeneket. Ha tréning-time penalty kerül a CoT-ra, a modell megtanul hazugságot rejteni a CoT-ba — és a monitorozható-jel megsemmisül.
- Egy gyengébb modell (GPT-4o) hatékonyan tudja monitorozni egy erősebb reasoning-modell (o3-mini) CoT-ját — messze hatékonyabb a misbehavior (reward-hacking, teszt-szubvertálás, user-deception) detektálására, mint az output-monitor egyedül.
- Best practice: hagyd a CoT-streamet érintetlenül; ha a usernek nem akarod megmutatni, sanitizáld egy külön modellel, de a raw streamet tárold el biztonsági-audithoz.
- Skálázódik szuperintelligenciára: emberi szintet meghaladó modellnél a CoT-monitor lehet az egyetlen ellenőrzési eszköz.
SET-fordításban ez a verifier-réteg új formája. Konkrét mintázat: primary reasoning-modell (o3-mini, DeepSeek-R1, Claude 3.7 Sonnet thinking) nyers CoT-streammel; olcsó független monitor-modell (GPT-4o, Claude Haiku, Gemini Flash) szabály-set alapján szűr; a riasztás human-in-the-loop sávra fut. A 2025-ös agent-stack négy rétege: modell, tool-szerződés, CoT-monitor, output-verifier — egyik se hagyható ki.
Latent Space — Husain és Shankar az evals-fegyelemről
A március 13-i Lightning Pod Hamel Husainnel (független ML-konzulens) és Shreya Shankarrel (UC Berkeley) egy közös evals-kurzust beharangozó beszélgetés. Két tézis. (1) Az evals “evergreen” terület — Hamel cikkei egy év óta változatlan elvekkel működnek; a modell-mező mozog, de az evals-mintázatok stabilak. (2) LLM-as-judge önmagában értéktelen humán-alignment nélkül. A kommerciális tooling 90%-a “off-the-shelf-judge-prompt”-tal szállít, és Hamel becslése szerint az iparban futó LLM-as-judge eval-ok 70-80%-a nem hasznos — nem volt iterációs round domain-szakértővel. A kurzus gyakorlata: per-domain annotation-app, amit Hamel clientenként újraépít, mert minden domain trace-rendering eltér.
A SET-fordítás: az evals-pipeline önálló műszaki kimenet, nem mellékmunka. Az LLM-as-judge-promptot első lépésben humán-evalni kell legalább 50 mintán, és minden modell-upgrade után újra.
Mellékszál — Snipd és Glean: két production-pattern
Március 14-i Latent Space — Kevin Ben Smith, a Snipd CEO-ja (Zürich, négyfős csapat). A Snipd-stack hibrid: self-hosted Whisper + speaker-diarization a magas-volumenű transcriptionre, plus closed API (OpenAI / Google / Perplexity) a kreatív, web-augmentált lépésekre (book-detection, guest-bio). Két praktikus mintázat: (1) hibrid modell-portfolió cost-tier szerint — “the iteration speed of closed APIs is unbeatable for a startup” —, és (2) production LLM-as-judge: olcsó modell 5 jelöltre, drága modell 1-et választ.
Peter Yang március 16-i interjúja Arvind Jainnel, a Glean ($100M ARR, 3 év) CEO-jával. Két konkrét tanulság: (1) két agent-típus mindkettő szükséges — user-triggered (“csinálj nekem ezt-meg-azt”) és event-triggered háttér-agent (“új sales-lead — gazdagítsd”); az utóbbi a Zapier-2.0 reasoning-réteggel. (2) Adat-minőség nem várható ki — az enterprise-data soha nem lesz tiszta, a kérdés a retrieval képessége. Plus MVP-tanács: “you can’t take two months to design a system and then build it over the next four — go in MVP-mode and don’t get attached to what you build.” Ez a W07-es Erik-tézis operations-oldali tükörképe.
Apróbb hírek a hétről
- Gemini 2.0 Flash native image generation. Március 12-én Google kiad egy experimentális modellt (
gemini-2.0-flash-exp), ami multimodális tokenstreamben kép- és szövegkimenetet generál. Nate B Jones március 13-i tesztjében három feature-t emel ki: szöveghelyes kép, karakter-konzisztencia (mese-illusztrációkban), pontos szelektív szerkesztés (“változtasd zöldre a sárkányt, mást ne nyúlj”). Nem fotó-realisztikus diffusion, hanem utasítás-követő image-modell — chatbot-UX-ben natívan. OpenAI várhatóan defenzív launch-csal válaszol. - “Copy-Paste Problem”. Nate B Jones március 15-i stratégiai videójában kimondja: az AI-éra alatt a SaaS-lock-in mintázata átíródik. “Loyalty ROI calculus has shifted — no one is loyal to tools the way they were.” Az új moat: nem feature-lock, hanem adat-be / adat-ki “highway” — a tool, ami könnyűvé teszi az export/import-ot, paradox módon több ügyfelet tart meg. A 2010-es Amazon-vs-retail “easy returns”-mintázat AI-megfelelője.
Mit viszünk magunkkal
A hét három IT-vezetői következtetést hagy ott:
- A Manus-mintázat reprodukálható. Egy enterprise-feladatra (szerződés-értelmezés, audit-walkthrough, IT-helpdesk-eskaláció) egy Sonnet- vagy GPT-4o-példány + 8-10 jól tervezett tool + olcsó verifier-modell elegendő egy v1-MVP-hez. A “wrapper” stigma helyett a tool-szerződés-design mint elsőrendű mérnöki hozzáadott-érték kerül fókuszba. Számolj 3-6 nap workshop + 4-8 hét MVP-vel közepes-komplexitású feladatra.
- CoT-monitor mint architektúra-elem. Ha reasoning-modellt vezetsz be, tervezd be a CoT-stream nyers tárolását + külön monitor-modell rétegét. Az OpenAI mérése szerint a CoT-monitor messze hatékonyabb misbehavior-detektálásra, mint az output-monitor egyedül. Költségbecslés: GPT-4o-monitor jellemzően a primary-modell költségének 5-10%-a.
- Evals-réteg mint önálló kimenet. A Husain-Shankar nézet szerint az LLM-as-judge humán-alignment nélkül megbízhatatlan. Belső projektnél a modell-választás előtt dönts az evalról: melyik 50-100 trace-mintát fogja humán-szakértő végigmenni, és milyen UI-ban? Ez 2-4 hét munka, és az egész stack megbízhatóságát ez alapozza meg.
A W12-13-ban várható: Anthropic Claude 3.7 Sonnet specifikációi (a W07-es rumor érlelődik), Mistral új release, és a Manus-kontextus continuous follow-upja.
Források
Fő forrás — Nate B Jones csatornája:
- 2025-03-10 · Manus AI: Explainer plus How it Beat ChatGPT — Manus-keret, Claude-Sonnet-leleplezés, “intelligence + tooling” tézis.
- 2025-03-11 · OpenAI Releases New Recommendations on AI Model Alignment via Chain of Thought — CoT-non-optimization-best-practice, alignment-implikáció.
- 2025-03-12 · OpenAI Drops New Agents API — Ecosystem Comparison with Claude MCP and LangChain — defenzív-OpenAI-keret, MCP-vs-Responses-API.
- 2025-03-13 · Google drops a new image model: Gemini 2.0 Flash Experimental — natív image-output, character-konzisztencia.
- 2025-03-15 · The Copy-Paste Problem: Why AI is Killing Software Lock-In — SaaS-lock-in átíródik, “data-in / data-out highway”-tézis.
Körbejárás / tech-mélység — Latent Space podcast:
- 2025-03-11 · The new OpenAI Agents Platform: CUA, Web Search, Responses API, Agents SDK — Roman Huet, Nikunj (OpenAI) — Responses API, file-search, computer-use, Agents SDK részletek.
- 2025-03-13 · Lightning Pod — Evals: How to Improve AI Consistently with Hamel Husain and Shreya Shankar — eval-as-engineering-discipline, LLM-as-judge-alignment-szabály.
- 2025-03-14 · Snipd: The AI Podcast App for Learning — with CEO Kevin Ben-Smith — hibrid self-host + API, production LLM-as-judge minta.
Termék-vezetői perspektíva — Peter Yang csatornája:
- 2025-03-16 · I Built a $100M Company in 3 Years by Betting on AI Agents — Arvind Jain (Glean) — enterprise-agent-platform, “agent-team körülöttem”-tézis, agile-MVP-szemlélet.
Fact-check és hivatkozott eredeti források:
- OpenAI — New tools for building agents (2025-03-11)
- OpenAI — Detecting misbehavior in frontier reasoning models (2025-03-10)
- arXiv 2503.11926 — Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation
- VentureBeat — OpenAI unveils Responses API, open source Agents SDK
- TechCrunch — OpenAI launches new tools to help businesses build AI agents
- MIT Technology Review — Everyone in AI is talking about Manus. We put it to the test.
- The Decoder — Chinese AI agent Manus uses Claude Sonnet and open-source technology
- Google Developers Blog — Experiment with Gemini 2.0 Flash native image generation (2025-03-12)
- Wikipedia — Manus (AI agent)
A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.