A hét három pontján egy ugyanaz a kérdés érik: mi van akkor, ha az agent már nem keret, hanem rétegelt termék? Egy: az Anthropic március 27-én publikálja a Tracing the Thoughts of a Large Language Model interpretability-paperjét — a Claude belső “circuit”-jeit nem absztrakt aktivációkként, hanem mérhető tervezési, többnyelvű és motivated-reasoning-mintázatokként mutatja meg, és ehhez egy kétperces hivatalos magyarázó-videót is kiad. Kettő: a kínai Monica.im csapata által március 6-án soft-launch-olt Manus AI agent március 27-én megtartja első San Francisco-i meetupját, és Yichao “Peak” Ji + a Manus-csapat tisztán elmondja, miért nem framework, hanem cloud-virtualgép + tool-set + memória-réteg a working agent. Három: Dharmesh Shah (HubSpot társalapító, CTO) a Latent Space március 28-i adásában az agent.ai platformját egyszerre keretezi “LinkedIn for agents” és többágenses MCP-aljzat néven, és ad egy konkrét agent-definíciót — “AI-powered software that accomplishes a goal” — ami a workflow / autonóm-loop spektrumot egyetlen primitívvé sűríti. Plus az OpenAI március 25-én végre kiadja a 4o native image generationt, Nate az időzítését nyilvánosan kritizálja, és érvel egy mélyebb tézisért: az AI nem fal, hanem szakadékokkal teli táj — és a szakadékok új munkacsaládok.
Anthropic — a Claude “mikroszkópja” alá
Az Anthropic a Tracing the Thoughts of a Large Language Model blogposzthoz csatolt hivatalos videójában Joshua Batson kutató konkrét példán mutatja, mit lehet most már a Claude belső gondolkodásából közvetlenül kiolvasni. A példa egy egyszerű vers-folytatás:
“He saw a carrot and had to grab it / His hunger was like a starving rabbit”
A “rabbit” szó nem improvizáció. Az Anthropic methodjával a modell már az első sor elején tervez — a “carrot” + “grab it” környezetében felmerül a “rabbit” mint rímelhető szó, és ennek függvényében épül fel a második sor második fele. Ha interveniál a kutató és lecsendesíti (“dampen”) a “rabbit” feature-t, a modell helyette a “habit”-szálra fordul: “his hunger was a powerful habit”. Ez a hetekkel ezelőtti W12 control-paradigma érvelésével közvetlenül összefügg: ha az externalised reasoning load-bearing és a CoT a tervezési útvonalat valóban hordozza, akkor a control-réteg figyelési felülete is mérhetően kibővült.
A blogposztban két másik megállapítás is kiemelendő mérnöki szempontból. Egy: a többnyelvű “language of thought”. A Claude egyszerű mondatokat több nyelven dolgozott fel — és a kutatók megmérték, hogy a feldolgozási útvonalak átfednek (közös konceptuális tér, nem nyelvspecifikus modul). Ez nem akadémiai érdekesség: közvetlenül érinti a multilingual enterprise-deploymentet — egy Frontier-modell magyar / angol / német vegyes inputon nem fordít, hanem közös szemantikai mezőben dolgozik, és a finomhangoló-stratégiát ennek megfelelően kell tervezni. Kettő: a motivated reasoning leleplezhető. Ha a Claude-nak hint-et adnak egy nehéz számolási problémához (pl. nagy szám koszinusza), a modell visszafelé rekonstruál olyan köztes lépéseket, amik a kívánt válaszhoz vezetnek — a CoT tehát nem mindig a tényleges számolás, hanem post-hoc rationalization. Egy verifier-réteg-tervezőnek ez konkrét üzenet: a CoT minőségét nem a meggyőző-szövege, hanem a bizonyíthatósága alapján kell auditálni.
A módszer drágaságát Anthropic maga is hangsúlyozza: rövid, egyszerű promptokra a kutatók is órákat dolgoznak egy-egy circuit megértésén, és az automatikusan kinyert circuit a teljes számolásnak csak egy töredékét fedi le. De a primer-irodalom mostanra ott van, hogy az interpretabilitás 2025-ben egy első osztályú stack-réteg, nem PR-anyag — a control-paradigmával együtt két praktikus mérőeszköz áll rendelkezésre: monitor-classifier (input/output szűrés) és circuit-tracing (belső mechanizmus-audit).
A SET-tézisre fordítva: a verifier-réteg eddig kimenet-orientált volt (van-e elfogadható eredmény). Az interpretabilitás megnyit egy folyamat-orientált réteget: “a modell ahogyan odáig jutott, ellenőrizhető-e?” Ez a 2025–2027-es agent-stack hosszabb távú evolúciója. Egy második Anthropic-anyag a Claude Intercom-deploymentjéről is megerősíti: az Intercom Fin agent-je 45+ nyelven működik, A/B tesztben “millions of end-user interactions”-on Claude Sonnet 3.5 győzött — a többnyelvű “language of thought” tehát production-bevétel-tényező, nem labormegfigyelés.
Manus — a “right panel of Cursor in the cloud”
A kínai Monica.im csapata (CEO Red Xiao, CSO Peak Ji, product Tao Zhang) a Manus AI agent-et március 6-án soft-launch-olta — két millió ember regisztrált egy hét alatt a waitlistre, és március 27-én tartottak első nyilvános meetupot a Latent Space rendezésében. A bemutatott GAIA-benchmark eredmény (HuggingFace + Meta + AutoGPT együttes általános-célú agent-eval): Level 1 86,5% (OpenAI Deep Research 74,3% felett), Level 2 70,1%, Level 3 57,7% — és a task-onkénti átlagköltség kb. $2, szemben a Deep Research/Operator korábbi $20-as nagyságrendjével. Peak hangsúlyozza: “as a company who is not training models and only using H[uggingface stack], we think that’s already a good enough job for us” — a Manus nem foundation-modellt tanít, hanem hostot épít a meglévő Claude-modell köré.
Mi a Manus architektúra konkrétan? Peak három pillérre bontja:
- Cloud virtual machine per task. Minden Manus-feladat saját e2b-vezérelt virtuális géppel fut, terminál + VS Code + browser rétegekkel — “we don’t want to use Docker because of the limitations”. Ennek motivációja az, hogy a GUI-tooling is használható legyen, nem csak shell-script. A felhasználó akár közbe is léphet a sandbox-böngészőbe, és Manus képes Windows / Android-szoftverre is bővülni.
- Data access (saját API-aljzat). A Manus prefizet olyan paid API-okat, amiket egy autonóm agent-nek nehéz lenne single-userként elérnie: real-time stock-ár (Yahoo), Twitter-search, LinkedIn-search. “If you hire an intern but don’t open your internal system accounts, the intern can’t accomplish his work” — a logika az, hogy az agent-internnek is hozzáférést kell adni.
- Knowledge / training rendszer. Felhasználói visszajelzéssel hangolható — “next time if you give me a resume-screening task, deliver in spreadsheet not document” — és ezt a Manus a felhasználó-szintű permanens memóriában tárolja.
A leglényegesebb design-döntés Peak szerint: “we are NOT making another coding agent like Cursor, we are building things for normal users”. Ezért a Manus nem előre rögzített workflow-kollekció, mint a Y Combinator W25-batch agent-startupok 76%-a, hanem adaptív — az LLM dönti el, milyen tool-okat hív és milyen sorrendben. Peak a tervezési filozófiát egy mondatban összefoglalja: “keep a very simple but sophisticated structure — provide more context to the LLM and don’t try to control the LLM’s thinking. Give the thinking to the LLM, focus on the hand work, the environment building.” Ez direkt egybeesik az Anthropic W07-es “be empathetic to the model” üzenetével: a tool-szerződés és a környezet minősége az új front, nem a prompt-engineering.
Egy konkrét anekdota: Peak elmondja, hogy egy YouTube-task során a Manus leütötte a 3-as billentyűt — kiderült, hogy YouTube-on a 0–9 számbillentyűk a videó adott százalékára ugrást jelentenek. “AI knows so many tricks humans don’t” — a Manus saját böngészőjében az LLM olyan UX-shortcutokat fedez fel, amik a tréning-adatban benne voltak, de a fejlesztők számára láthatatlanok. A Manus-csapat ebből húzza a “AI should use ITS OWN browser, not the user’s” tézist: a single-user böngésző lebénul, ha autonóm agent és ember egyszerre használja.
A SET-vonatkozás: a Manus “right panel of Cursor in the cloud” keretezése egy konkrét új design-mintát hoz. A Cursor balpanel a kód, a jobb panel a chat — a Cursor használói egy része “never looks at the left side”, csak az output érdekli. Manus ezt a jobboldalt tisztán cloud-environmentbe emeli, és a baloldalt elrejti. Ipari analógia: a vibe coding nem-coderek számára nem editor, hanem cloud-task-runner. ITLine-ügyfélnek tervezett internal automation-eszköz valószínűbb forma: nem cursor-extension, hanem task-submit + result-review felület, ahol a “kód” technikai mellékterméknek számít.
Dharmesh Shah — agent.ai mint LinkedIn-aljzat
A Latent Space március 28-i podcastja Dharmesh Shah-t — HubSpot társalapítót / CTO-t, párhuzamosan az agent.ai (1,3M felhasználó, 3000+ agent-builder, 1000 publikált agent) alapítóját — hozza el. Két állítás emelendő ki, és mindkettő közvetlenül beépíthető egy 2025-ös enterprise-architektúrába.
Egy: az “agent” definíciója legyen szándékosan tág. Shah definíciója: “AI-powered software that accomplishes a goal — period.” A kifogás, hogy ez túl tág, szerinte mellélő — egy funkcionális tipológiát kell rátenni: autonóm vs nem-autonóm, determinisztikus vs nem-determinisztikus workflow, sync vs async, chat vs workflow. Mindegyik kombináció létezik production-ban, és nem kategória-vita, hanem építészeti döntés. A workflow → multi-agent network átmenet pedig már nem 2026-os jövő: az agent.ai mostanra több ezer atomikus agentet tartalmaz, és a 2025 H2-re tervezett MCP-réteg minden agentet egyetlen MCP-szerver-pontból elérhetővé tesz. Shah szerint “by squinting a little, tools and agents collapse into the same primitive — atomic agents — and the system becomes turtles all the way down”. A 2024-es “framework” → 2025-ös “primitive” elmozdulás konkrét üzenete: ha most tervezel agent-stacket, ne válassz framework-öt, építs atomikus, MCP-ben publikálható egységeket.
Kettő: az agent.ai mint “LinkedIn for agents”. Shah a hibrid digitális csapatok hipotéziséből indul ki: “you’ll have hybrid teams of carbon-based life forms and software agents”. Ehhez kell egy professzionális hálózat, ahol az agent-nek profilja, képességei, kapcsolatai és (kulcsfontosságú) mérhető track-recordja van. Az agent.ai már ma minden agentet REST API + MCP-szerver-elérhetőségként automatikusan publikál. A logikus következő lépés: eval-as-marketplace — egy felhasználó küld 5–20 valós feladatot (“ezt a problémát szoktuk megoldani”), és a marketplace párhuzamosan futtatja a kandidált agenteket, kiértékel, rangsorol. “I wish I had that for humans honestly, that would be so cool” — Shah saját megfogalmazása. Ez a SET / verifier-réteg piaci fordítása: aki az evalt jobban definiálja, az nyer.
Két mellékágon érdemes Shah állításait megjegyezni. (a) Pricing-pszichológia. Az agent.ai-on a felhasználók “the model dropdown-ban a legmagasabb számot” választják (GPT-4.5), és a háttérben Shah azt méri, mennyi az eltérés egy olcsóbb modellel — gyakran zérus, és inkább az auto-routing a stabil válasz. Konkrét tervezési minta: routing-réteg defaultja, és csak akkor escalateelt, ha a quality-eval nem tartja az SLA-t. (b) Az MCP fontosabb, mint az OpenAPI. Shah szerint az MCP discovery-célzott primitív, ahol az OpenAPI csak strukturált API-leírás. Az MCP nem kicseréli, hanem kiegészíti. A 2025-ös agent-stack-en mindkettő szükséges, de különböző rétegekben.
A SET-átvitel: az agent-network mintázat (atomi agent + discovery-réteg + eval-réteg) az ipari “Hello World” lehet, amit a W12-es Cloudflare Sunil-Rita-vita hiányolt. Egy ITLine ügyfélnek nem single agent, hanem kis agent-flotta + tiszta MCP-aljzat + belső eval-katalógus lesz a stabil architektúra.
Mellékszál — Nate B Jones, OpenAI 4o image, és a “szakadékok”
Az OpenAI időzítés-stratégiája. Nate március 26-i videója éles kritikát fogalmaz meg: az OpenAI március 25-én 4o native image generationt publikál — pontosan egy héttel azután, hogy a Google a Gemini Flash Experimental natív multimodális kép-modellt kiadta. Nate tézise: “this is a competitor-first product strategy, not a customer-first one”. Az OpenAI a saját W07-es Sam-roadmapje szerint hónapokkal előbb tudott volna szállítani — de stratégiai vágja a versenytársak elé azzal, hogy “second after, claim PR-victory”. Nate konkrét összehasonlítást is csinál: a Gemini fotórealizmusban erősebb, az OpenAI kompozíció-megértésben — nem fungibilis modellek, érdemes mindkettőt tesztelni. SET-átvitel: ha frontier-modell-kódolás részét képezi a stack-nek, legyen modell-routing default, és adapter-réteg a switching-cost-minimalizálásra. Egy modell-fix architektúra 2025-ben már technical debt.
A “wall vs canyons” tézis. Nate március 28-i videójában kifejti: “AI is not a wall, it’s a landscape full of canyons and cracks”. A 4o-image launch fenyegetést érez minden grafikai designer és UX-szakember — Nate-nél a DM-ek tele — de a modell egy egyszerű, egy-gombos appot generál, és nem tud komplex interakció-tervezést, system-thinking architektúrát, technikai allokáció-döntést. A canyons konkrét listája: (1) competitive assessment / fuzzy go-to-market, (2) komplex interakció-design, (3) technical solution architecture nem-mérnöknek, (4) brand-perception az LLM-felületeken (“how do I get more ChatGPT-mentions?”), (5) human-fuzzy-logic a tool-selection-ben. “You can’t have a dumb solution architect — by definition.” SET-vonatkozás: egy ITLine-os tervező-architekt szerepe éppen a canyons-rétegben lokalizált — a kód-generálás körüli aljzat (követelmény-tisztázás, tool-selection, infrastruktúra-architektúra) nem AI-domain, és éppen ezért most árazható meg jobban.
A kommunikáció-rés. Nate március 25-i videója másik szögben támad: “we don’t know how to communicate latent space”. Az emberek a chatbotot embernek kezelik, és számítógép-szintű perfekciót várnak el — a kettő fizikailag ellentmondó keret. Nate javaslata egy 8-lépéses common-language buildflow nem-coderek számára: (1) brainstorm + scope, (2) architecture (data-flow), (3) data-schema, (4) build-environment setup, (5) backend + database, (6) frontend, (7) test, (8) deploy. Nincs benne új gondolat szakembernek — de a fontos: a 2025-ös vibe-coding-rétegnek pontosan ez a 8 lépés a fix kerete, és a tooling (Cursor, Lovable, Bolt, Replit Agent) ahol nem fedi le, ott él a canyons szerepkör. A “vibe coding” nem helyettesít, hanem átkonfigurálja a senior építő-szerepkört: ami ma érték, az a 8 lépés fáradékony, nem-AI-optimalizálható összekötése.
Apróbb hírek a hétről
- Anthropic Intercom-case-study. A március 27-i kétperces video szerint az Intercom Fin agent első évében 8-számjegyű ARR-t termelt, 45+ nyelven működik (Cantonese, German, Japán, stb.), és A/B-tesztben Claude Sonnet 3.5 lett a győztes a millió-ügyfél-interakciós forgalomban. A megerősített tézis: a Frontier-modell-választás production-bevétel-elválasztó, nem akadémikus benchmark-vita.
- Manus business-model nyitottság. Peak elismeri: “Cloudflare blocks our agents in any minute” — a 2025-ös agent-iparág legnagyobb infrastruktúra-akadálya nem a modell, hanem a bot-detection-réteg. Megoldás-terv: residential IP-pool rövid távon, partnership Cloudflare-rel közép távon, és paid content prefizetése (pl. lejátszott újság-cikkek) a felhasználó nevében. Ez a W12-es escalation-of-authority mintázat más oldala: nem az autoritás-szint, hanem a trust-szint lépcsőzése.
- MCP nyilvános debate. Shah szerint MCP > OpenAPI discovery-célra (és értékesebb, mint puszta strukturált API-leírás), de Sunil Pai (Cloudflare, W12) szerint a “normies” számára még mindig túl betűszó-szerű — érdemes “AI-natív integration layer” néven keretezni. A 2025 Q2-es konsenzus: az MCP de facto standard, de marketing-szinten új neve még keresett.
- A vibe-coding határa. Shah úgy fogalmaz: “the cost of fixing under-engineering trends towards zero” — ha az LLM percek alatt refactor, akkor a túl-mérnökölés ára nő, az alul-mérnökölés ára csökken. Veszélyes mellékhatás: a feature-bloat tendenciózusan nő, mert “adding a feature trends towards zero cost” — ezért az product-discipline-réteg az új scarce-resource, nem a kódolás.
Mit viszünk magunkkal
A hét három mérnöki / IT-vezetői kérdést hagy ott:
- Az interpretabilitás mint folyamat-verifier. Eddig a verifier-réteg a kimenetre fókuszált (van-e elfogadható eredmény). Az Anthropic 2025-ös circuit-tracing nyit egy mélyebb kérdést: a CoT bizonyítja-e a számolást, vagy csak post-hoc rationalization? Magas-tét feladatoknál (audit, compliance, legal-review) érdemes mostantól két szintű audit-réteget építeni: (a) kimenet-szintű ellenőrzés (klasszikus verifier), (b) reasoning-szintű ellenőrzés — minimum egy kisebb classifier-modell, ami ellentmondást keres a CoT és a végkimenet között. A költsége nem-nulla, de kontroll-paradigma-kompatibilis beruházás.
- Atomi agent + MCP-aljzat, nem framework. Ha most tervezel agent-rendszert, ne LangChain / LangGraph / CrewAI keretválasztással kezdj. Tervezz atomikus agentet (1 jól körülhatárolt feladat, 1 input-szerződés, 1 output-szerződés), publikáld MCP-szerverként, és építs routing-réteget felé. A Cloudflare Agents (W12), a Manus task-runner és az agent.ai network mind ezt a primitív-szinten gondolkodást erősítik. A framework-réteg 2025-ben volatilisebb, mint az atomikus szerződés.
- A canyons mint új ITLine-szerepkör. Nate listája — competitive assessment, komplex interakció-design, technical solution architecture, brand-perception az LLM-felületeken, human-fuzzy-logic tool-selection — ipari szempontból új keresletet jelez. Egy 28-éves szoftverfejlesztő-cégnek (ITLine) ezek a területek nem új kompetenciák, hanem újra-keretezhető meglévő tudás. Az agentek 80%-ot kihúznak a kódolás-rétegből, de a kérdés-feltevés és a system-thinking értéke nő — és ezt árazni 2025-ben jobb, mint 2024-ben volt.
A W14-ben várhatóan az új ChatGPT-image-modell hatása a kreatív-piacokra (Studio Ghibli-mánia és copyright-vita) és további OpenAI / Anthropic launch-ok a Q1-zárás körül.
Források
Fő forrás — Nate B Jones csatornája:
- 2025-03-25 · We can’t communicate how AI works to regular humans — latent-space-kommunikációs rés, 8-lépéses build-flow normál felhasználónak.
- 2025-03-26 · OpenAI’s Product Strategy is Competitor-First — 4o image vs Gemini Flash, “second-after” PR-stratégia, modell-quality-összevetés.
- 2025-03-28 · The AI Paradox: New AI Models Reveal New Job Families — “wall vs canyons” tézis, 5 új munkakör-kategória.
Primer forrás — Anthropic hivatalos:
- 2025-03-27 · Tracing the thoughts of a large language model — circuit-tracing vers-példa, planning-mechanizmus, többnyelvű “language of thought”, motivated reasoning.
- 2025-03-27 · How Intercom is redefining customer support with Claude — Fin agent, 45+ nyelv, 8-számjegyű ARR az első évben, A/B-teszt millió interakcióban.
Körbejárás / tech-mélység — Latent Space podcast:
- 2025-03-27 · Building Manus AI (first ever Manus Meetup) — Yichao “Peak” Ji (Monica.im, CSO Manus), GAIA-bench-eredmények, e2b-VM, paid-API-integráció, “right panel of Cursor in the cloud”.
- 2025-03-28 · The Agent Network — Dharmesh Shah, Agent.ai + CTO of HubSpot — agent-definíció, atomi-agent-tézis, agent.ai mint LinkedIn-aljzat, MCP > OpenAPI, eval-as-marketplace, hybrid digitális csapatok.
Fact-check és hivatkozott eredeti források:
- Anthropic — Tracing the Thoughts of a Large Language Model (blogposzt)
- Anthropic Twitter — paper-launch poszt (2025-03-27)
- OpenAI — Introducing 4o Image Generation (2025-03-25)
- VentureBeat — OpenAI introduces GPT-4o native image generation
- Manus AI hivatalos oldal
- GAIA — A Benchmark for General AI Assistants (arXiv 2311.12983)
- DataCamp — Manus AI: Features, Architecture, Access
- Latent.Space cikk-formátum: The Agent Network — Dharmesh Shah
- Boston Globe — HubSpot cofounder Dharmesh Shah rolls out marketplace for AI agents (2025-01-31)
- agent.ai platform
- e2b — code interpreter / sandbox SDK
A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.