A hét az “agent-architektúra” kérdést kategóriaszintre emeli: a frontvonalat nem a modell-választás, hanem a kontextus tervezése dönti el. Egyfelől Walden Yan (Cognition, a Devin építői) június 12-én esszét publikál “Don’t Build Multi-Agents” címmel: a többszereplős agent-stackek törékenyek, mert a kontextus-megosztás megoldatlan probléma. Másfelől kevesebb mint 24 órával később az Anthropic kiadja a How we built our multi-agent research system blogposztot, és — ellentétes következtetéssel — bemutatja, hogyan vert meg egy lead-subagent rendszer egyetlen Opus 4-et több mint 90%-kal belső eval-on. Harmadrészt az Anthropic hivatalos podcast MCP-vel foglalkozik: hogyan lett egy belső copy-paste-frusztrációból iparági integrációs protokoll. A Latent Space pedig Noam Brown-nal készít interjút, aki kimondja: routerek és scaffoldok rövid távon hasznosak, hosszú távon a skálázás elmossa őket.
A közös szál: az agent-stack mérnöki érettsége nem a “melyik modell” kérdése, hanem hogy ki építi tisztábban a kontextust, a tool-szerződéseket és a verifier-réteget köré. A héten Andrej Karpathy — egy virálissá vált poszttal — nevet is ad neki: context engineering.
A Cognition–Anthropic-vita: ugyanaz a probléma, két ellentétes válasz
Június 12.: Walden Yan (Cognition co-founder) publikálja a Don’t Build Multi-Agents esszét. Központi tézise: az agentek között nem oszlik meg jól a kontextus, ezért parallel subagentek konfliktáló döntéseket hoznak — a Devin-csapat empirikus tapasztalata, hogy a single-agent architektúra megbízhatóbb, és a “context engineering” egyetlen, koherens loopban végezhető tisztán. Walden konkrét anti-mintát is ad: ha két subagent egyidejűleg dolgozik egy issue-n, és nem látja egymás trace-ét, könnyen mond ellent egymásnak.
Június 13.: az Anthropic kiadja a How we built our multi-agent research system blogposztot — a Claude Research-feature (Deep Research) lead-subagent topológiát futtat (egy Opus 4 vezérel, több Sonnet 4 párhuzamosan keres és aggregál), és több mint 90%-kal veri a single-agent baseline-t belső eval-on. A trade-off explicit: kb. 15× több tokent égetnek, mint egy chat-interakció. A poszt keretezi a Cognition-állítást: “agents work well for tasks where the value of the outcome justifies the cost” — az open-ended kutatás ilyen feladat, a kódbázis-állapot-szinkronizálás (Devin) gyakran nem.
Nate B Jones június 17-i videójában húzza fel erre a teljes 2025-ös agent-reality-check-keretet:
- Token-burn mint architektúra-paraméter. “Multi-agent systems are an efficient way to burn up enough tokens to get to correctness” — vagyis a multi-agent akkor érdemes, ha a feladat megérdemli a token-költséget. Ez egybecseng a W07-es anthropic-féle verifier-sweet-spot-kerettel.
- Talent-előfeltétel. A multi-agent-rendszer csak ott áll össze, ahol a csapat mélyen érti a kontextus-megosztás és state-management problémát. Az Anthropic-csapat ott van; sok enterprise-team nincs — Walden ennek ad nyelvet a “don’t build multi-agents (yet)”-tel.
A vita egy harmadik tisztázással is összekapcsolódik: az Apple “Illusion of Thinking”-papír — amely a reasoning-modellek “összeesését” állította nagy komplexitásnál — rebuttal-papírt kapott Lawsen-től (Open Philanthropy) Claude Opus társszerzőséggel: az Apple-experimentben a Tower of Hanoi-feladatra szabott token-budget kicsi volt (“the pattern continues, but I’ll stop here to save tokens”), és amikor a feladatot rekurzív Lua-függvény-generálásként adták át, 15-disk Hanoi is működött. A tanulság ugyanaz: a token-allokáció és a kontextus-tervezés a kérdés, nem a modell képessége.
Az MCP — copy-paste-frusztrációból iparági integrációs protokoll
Az Anthropic hivatalos podcastja június 16-án három fős beszélgetést hoz David (MCP társalkotó), Theo (PM) és Alex (Cloud Relations) részvételével. A 19 perces epizód három szempontból érdekes, ha enterprise-AI-stacket tervezel.
Az eredet. David szerint az MCP egy konkrét személyes irritáció-ból indult: kontextust akart mozgatni a Claude Desktop és az IDE-je között, és megunta a copy-paste-et. A protokoll három alap-primitívet definiál: tools (modell-által-hívható akciók), resources (RAG-be tölthető nyers adat), prompts (slash-commandként megjelenő prompt-template-ek). A rendszer a klasszikus client-server-pattern: a Claude (vagy más AI-app) a kliens, az MCP-szerver egy adott tool-set tulajdonosa.
Az inflexiós pont. 2024 szeptemberében az Anthropic-belső hackathon-on mindenki MCP-szervert épített — Slack-integráció, 3D-printer-vezérlés, sőt egy ajtó-portás-szerep. “Within five minutes you have something going” (Theo) — ez a low-friction-élmény vitte át belső tooling-ból nyilvános protokollba. November 2024-es launch után fél év alatt 10 000+ MCP-szerver él a nyilvános ökoszisztémában.
Mit hoz a következő hónapokban. Theo három roadmap-tételt nevez meg: (1) registry API — az agentek dinamikusan keresnek új MCP-szervereket egy katalógusban (a “10 előre konfigurált tool” helyett “ad-hoc tooltár-bővítés”). (2) Long-running tasks — primitívek a hosszú futású agent-loopokhoz. (3) Elicitation — a szerver visszakérdezhet a usertől, ha paramétert kell tisztáznia. Ez azért fontos, mert a 2025 H2-ben deklarált 7-8 órás runtime-agentek nem tudnak némán futni — vissza kell kérdezniük.
A nyitott kérdés egyetlen mondatban: lesz-e ebből HTTP-szintű dolog, vagy egy időszakos integration-rétegbe ragad. Theo szándékosan szerény: “just make something that people want to use” — nem erőlteti a HTTP-analógiát.
Context engineering — a 2025-ös új diszciplína név-keresztelése
Június 19-én Andrej Karpathy posztolja a hét legtöbbet idézett mondatát: “+1 for ‘context engineering’ over ‘prompt engineering’.” A poszt sztorija: a prompt engineering az utóbbi két évben elszennyeződött (jailbreak-trükkök, magic words), miközben az igazi mérnöki feladat — a kontextus-ablak sokrétű, koherens feltöltése — rejtve maradt. A poszt percek alatt felkapott; Tobi Lütke (Shopify CEO) felerősíti, Simon Willison kontextusba teszi.
Nate június 20-i videója ezt a fogalmat konkrét keretbe csomagolja, ami közvetlenül használható verifier-réteg-tervezésnél. Két szintre bontja:
- Determinisztikus kontextus. A modellnek közvetlenül átadott elemek: system prompt, rule-set, user-prompt, feltöltött dokumentumok, RAG-eredmények. Itt a feladat mérhető, reprodukálható.
- Probabilisztikus kontextus. Amikor az agent webet vagy MCP-szervert elér: 400-600 weboldalt is bejár, és a determinisztikus prompt csepp a tengerben. A modell viselkedését itt nem kontrollálod, csak alakítod azzal, hogy milyen forrás-megkötéseket adsz:
verified news sites,academic articles,internal docs only. Nate explicit: a ChatGPT Deep Research outputjával gyakran elégedett, de a forrás-listával ritkán — “the sources seem quite sketchy at times”.
Nate 5 alapelve: (1) discovery várakozás — a prompt designolja, merre “túr” az agent; (2) forrás-monitoring és időbeli drift; (3) prompt-injection biztonsági feltételezés MCP-szervereken; (4) decision accuracy mint elsődleges metrika a klasszikus precision/recall helyett; (5) prompt-versioning kötelező.
A jelentős átkeretezés: az eval-harness új generációja a probabilisztikus kontextus minőségére kell tervezzen — forrás-aggregáció, source-relevance scoring, drift-detekció — “precision and recall implicitly assume a deterministic context window, and you don’t necessarily have that anymore”.
Latent Space — Noam Brown arról, mit mos el a skálázás
A június 19-i Latent Space epizód Noam Brown-nal beszél (OpenAI, ex-Meta FAIR, Cicero diplomácia-bot, o-sorozat reasoning). Három pont különösen nyugtalanítóan releváns egy 2025-ben építő mérnök-csapatnak:
A router elmúlik. A dual-mode router (gyors válasz vs. mély reasoning) Anthropic-mintázat ma — Brown viszont kimondja: az OpenAI egy egyesített modell felé halad, ami magában dönti el. “In that world you shouldn’t need a router on top of the model.” Rövid távon hasznos, de 6-12 hónapra építeni rá az enterprise-stacket veszélyes.
A scaffold elmúlik. “Before reasoning models emerged, there was all this work that went into engineering agentic systems that made a lot of calls to GPT-4o to get reasoning behavior. Then it turned out: oh, we just created reasoning models, and you don’t need this complex behavior.” Brown tanácsa: ha 6 hónap alatt épülő scaffoldot tervezel, kérdezd meg, melyik komponense fog 6 hónap múlva eltörlődni.
Harness-mentesség mint cél. Pokémon-játszó o3-példán illusztrálja: az ideális harness a no-harness. Az iparban gyakran fordítva csinálják: ha a model nem teljesít, harness-szel feldopolják — Brown ezt technical debt-ként kezeli.
A közös szál: a “modell-független mérnöki réteg” (verifier, eval-harness, RFT-data-gyűjtés) sokkal stabilabb beruházás, mint a modell-pillanatkép-függő scaffoldok.
Apróbb hírek a hétről
- McKinsey-deck-baleset. Nate ugyanabban a június 17-i videóban konkrét tanácsadó-decket boncol szét: a prezentáció Haiku-t és Llama 3 8B-t, Gemini Nano-t, Mistral Small-t ajánl mint “state-of-the-art”, agentic AI mesh buzzword-keretben, konkrét szerződés vagy állapot-séma nélkül. Aki ilyenre építi a 2025-ös agent-pillérét, a következő évben dobja ki.
- Dev-pipeline a knowledge work-re. Nate június 18-i videójában érdekes mintát ír le: dokumentum-készítésre mintha CI/CD lenne — fogalmazás Opus 4-tel, fact-check Perplexity-vel, polish Sonnet 4-tel, “merge” peer-review után. A pont nem a konkrét stackje, hanem hogy a knowledge-worker-szoftvereink még analógiásan se állnak ott, ahol a code-tooling.
- LLM-ek túl agreeable. Nate június 19-i videója egyetlen technikai pontot rögzít: minden frontier-modell két prompton belül elmozdítható egy állásponttól. “I have never seen an LLM with a core of conviction I could not move in one or two prompts.” RLHF-örökség: a “helpfulness” és “sycophancy” közti vonal a modell perspektívájából nincs. Nagy döntés előtt promptolj disagreement-re.
Mit viszünk magunkkal
A hét három mérnöki / IT-vezetői kérdést hagy ott:
- A multi-agent-architektúra explicit ROI-számolás. A Cognition–Anthropic-vita azért érdekes, mert mindkét oldal igaza van — eltérő feladatokra. Open-ended kutatás megéri a 15× tokent; egy tight-context-coding-feladat jellemzően nem. Mielőtt multi-agent mellett dönt egy projekt, érdemes megválaszolni: a feladat verifikálható? a token-költség 10-15× feléri? a csapat érti a context-sharing-et? Ha bármelyikre nem, single-agent + verifier-réteg az olcsóbb és stabilabb választás.
- Az MCP-mintázat felé érdemes fejlődni. Még ha nem is most kapcsolod be a stackedet MCP-szerver-formában, a tool-szerződés-első-tervezés — világos signature, dokumentált error-state, idempotens hívás-séma — közvetlenül az MCP-pattern-ből építhető, és a saját agent-stackedet is olvashatóbbá teszi. Egy belső eszköz-adapter MCP-szerver-formában ma már Claude Desktop, Cursor, Windsurf-environmentben hozzáférhető.
- A context engineering az új eval-frontvonal. A gyakorlati teendő: a saját AI-stack-eden szét kell választani a determinisztikus és a probabilisztikus kontextust. Az előbbin (rules, system prompt, RAG) a klasszikus eval marad. Az utóbbin (web-search, MCP, autonóm tool-call) forrás-relevance-scoring és source-drift-monitoring kell. Ez egybecseng a SET-féle external verifier tézissel: a verifikáció nem a modell-output szintjén él, hanem a teljes context+output-tuple szintjén.
A W26-ban OpenAI o3-pro-elemzések, Meta Behemoth halasztás-rumor, és további MCP-registry-API-részletek várhatóak.
Források
Fő forrás — Nate B Jones csatornája:
- 2025-06-17 · The 2025 AI Agent Reality Check: Power-Law Adoption, Agent Wars, and Single- vs. Multi-Architectures — a Cognition–Anthropic-vita keretezése, McKinsey-deck-szétszedés, eval mint sine qua non.
- 2025-06-18 · Code Evolved More in 60 Years than Writing did in 5,000 — Now AI is About to Rewrite Writing — knowledge-work mint dev-pipeline-analógia.
- 2025-06-19 · Too Helpful to Think: The Hidden Cost of AI in Major Life Decisions — LLM-sycophancy mint RLHF-örökség, prompt-for-disagreement-stratégia.
- 2025-06-20 · Context Engineering vs. Prompt Engineering: Guiding LLM Agents — determinisztikus vs. probabilisztikus kontextus, 5-pontos eval-elv.
Primer forrás — Anthropic hivatalos:
- 2025-06-16 · The Model Context Protocol (MCP) — David, Theo, Alex (research / PM / Cloud Relations) — MCP-eredet, hackathon-pivot, registry API + long-running + elicitation roadmap.
Körbejárás / tech-mélység — Latent Space podcast:
- 2025-06-19 · Scaling Test Time Compute to Multi-Agent Civilizations — Noam Brown, OpenAI — routerek és scaffoldok elmúlnak, harness-mentesség mint cél, RFT-data-gyűjtés stabil befektetésként.
Fact-check és hivatkozott eredeti források:
- Cognition — Don’t Build Multi-Agents (Walden Yan, 2025-06-12)
- Anthropic — How we built our multi-agent research system (2025-06-13)
- Andrej Karpathy — “+1 for context engineering over prompt engineering” (X, 2025-06-19)
- Apple — The Illusion of Thinking (2025-06)
- Lawsen & Claude Opus — The Illusion of the Illusion of Thinking (arXiv, 2025-06)
- Simon Willison — Anthropic: How we built our multi-agent research system (2025-06-14)
- Simon Willison — Context engineering (2025-06-27)
A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.