Heti AI-hírlevél · ITLine

2025-W25   2025-06-16 — 2025-06-22   ·   9 forrás

W25 — Cognition vs. Anthropic agent-háború, MCP mint új HTTP, és a context engineering mint központi diszciplína

Cognition és Anthropic 24 órán belül publikál egymással szembemenő agent-architektúra-esszét — single-agent vs. multi-agent. Az Anthropic csapata MCP-podcastben fejti ki, miért lett egy belső copy-paste-frusztrációból iparági integrációs protokoll. Karpathy megnevezi a ‘context engineering’-et mint 2025 igazi diszciplínáját, Noam Brown a Latent Space-en a routerek és scaffoldok jövőjéről beszél.

Kép helye — Két oldal: bal oldalt egy single-agent (Devin) és egy multi-agent (Anthropic Research) diagram szemben — közös cím: ‘Context Engineering’. Jobb oldalt egy MCP-szerver-ikonostáz (Slack, GitHub, 3D-printer, synth) Claude-tól induló tool-call-nyilakkal.

A hét az “agent-architektúra” kérdést kategóriaszintre emeli: a frontvonalat nem a modell-választás, hanem a kontextus tervezése dönti el. Egyfelől Walden Yan (Cognition, a Devin építői) június 12-én esszét publikál “Don’t Build Multi-Agents” címmel: a többszereplős agent-stackek törékenyek, mert a kontextus-megosztás megoldatlan probléma. Másfelől kevesebb mint 24 órával később az Anthropic kiadja a How we built our multi-agent research system blogposztot, és — ellentétes következtetéssel — bemutatja, hogyan vert meg egy lead-subagent rendszer egyetlen Opus 4-et több mint 90%-kal belső eval-on. Harmadrészt az Anthropic hivatalos podcast MCP-vel foglalkozik: hogyan lett egy belső copy-paste-frusztrációból iparági integrációs protokoll. A Latent Space pedig Noam Brown-nal készít interjút, aki kimondja: routerek és scaffoldok rövid távon hasznosak, hosszú távon a skálázás elmossa őket.

A közös szál: az agent-stack mérnöki érettsége nem a “melyik modell” kérdése, hanem hogy ki építi tisztábban a kontextust, a tool-szerződéseket és a verifier-réteget köré. A héten Andrej Karpathy — egy virálissá vált poszttal — nevet is ad neki: context engineering.

A Cognition–Anthropic-vita: ugyanaz a probléma, két ellentétes válasz

Június 12.: Walden Yan (Cognition co-founder) publikálja a Don’t Build Multi-Agents esszét. Központi tézise: az agentek között nem oszlik meg jól a kontextus, ezért parallel subagentek konfliktáló döntéseket hoznak — a Devin-csapat empirikus tapasztalata, hogy a single-agent architektúra megbízhatóbb, és a “context engineering” egyetlen, koherens loopban végezhető tisztán. Walden konkrét anti-mintát is ad: ha két subagent egyidejűleg dolgozik egy issue-n, és nem látja egymás trace-ét, könnyen mond ellent egymásnak.

Június 13.: az Anthropic kiadja a How we built our multi-agent research system blogposztot — a Claude Research-feature (Deep Research) lead-subagent topológiát futtat (egy Opus 4 vezérel, több Sonnet 4 párhuzamosan keres és aggregál), és több mint 90%-kal veri a single-agent baseline-t belső eval-on. A trade-off explicit: kb. 15× több tokent égetnek, mint egy chat-interakció. A poszt keretezi a Cognition-állítást: “agents work well for tasks where the value of the outcome justifies the cost” — az open-ended kutatás ilyen feladat, a kódbázis-állapot-szinkronizálás (Devin) gyakran nem.

Nate B Jones június 17-i videójában húzza fel erre a teljes 2025-ös agent-reality-check-keretet:

A vita egy harmadik tisztázással is összekapcsolódik: az Apple “Illusion of Thinking”-papír — amely a reasoning-modellek “összeesését” állította nagy komplexitásnál — rebuttal-papírt kapott Lawsen-től (Open Philanthropy) Claude Opus társszerzőséggel: az Apple-experimentben a Tower of Hanoi-feladatra szabott token-budget kicsi volt (“the pattern continues, but I’ll stop here to save tokens”), és amikor a feladatot rekurzív Lua-függvény-generálásként adták át, 15-disk Hanoi is működött. A tanulság ugyanaz: a token-allokáció és a kontextus-tervezés a kérdés, nem a modell képessége.

Az MCP — copy-paste-frusztrációból iparági integrációs protokoll

Az Anthropic hivatalos podcastja június 16-án három fős beszélgetést hoz David (MCP társalkotó), Theo (PM) és Alex (Cloud Relations) részvételével. A 19 perces epizód három szempontból érdekes, ha enterprise-AI-stacket tervezel.

Az eredet. David szerint az MCP egy konkrét személyes irritáció-ból indult: kontextust akart mozgatni a Claude Desktop és az IDE-je között, és megunta a copy-paste-et. A protokoll három alap-primitívet definiál: tools (modell-által-hívható akciók), resources (RAG-be tölthető nyers adat), prompts (slash-commandként megjelenő prompt-template-ek). A rendszer a klasszikus client-server-pattern: a Claude (vagy más AI-app) a kliens, az MCP-szerver egy adott tool-set tulajdonosa.

Az inflexiós pont. 2024 szeptemberében az Anthropic-belső hackathon-on mindenki MCP-szervert épített — Slack-integráció, 3D-printer-vezérlés, sőt egy ajtó-portás-szerep. “Within five minutes you have something going” (Theo) — ez a low-friction-élmény vitte át belső tooling-ból nyilvános protokollba. November 2024-es launch után fél év alatt 10 000+ MCP-szerver él a nyilvános ökoszisztémában.

Mit hoz a következő hónapokban. Theo három roadmap-tételt nevez meg: (1) registry API — az agentek dinamikusan keresnek új MCP-szervereket egy katalógusban (a “10 előre konfigurált tool” helyett “ad-hoc tooltár-bővítés”). (2) Long-running tasks — primitívek a hosszú futású agent-loopokhoz. (3) Elicitation — a szerver visszakérdezhet a usertől, ha paramétert kell tisztáznia. Ez azért fontos, mert a 2025 H2-ben deklarált 7-8 órás runtime-agentek nem tudnak némán futni — vissza kell kérdezniük.

A nyitott kérdés egyetlen mondatban: lesz-e ebből HTTP-szintű dolog, vagy egy időszakos integration-rétegbe ragad. Theo szándékosan szerény: “just make something that people want to use” — nem erőlteti a HTTP-analógiát.

Context engineering — a 2025-ös új diszciplína név-keresztelése

Június 19-én Andrej Karpathy posztolja a hét legtöbbet idézett mondatát: “+1 for ‘context engineering’ over ‘prompt engineering’.” A poszt sztorija: a prompt engineering az utóbbi két évben elszennyeződött (jailbreak-trükkök, magic words), miközben az igazi mérnöki feladat — a kontextus-ablak sokrétű, koherens feltöltése — rejtve maradt. A poszt percek alatt felkapott; Tobi Lütke (Shopify CEO) felerősíti, Simon Willison kontextusba teszi.

Nate június 20-i videója ezt a fogalmat konkrét keretbe csomagolja, ami közvetlenül használható verifier-réteg-tervezésnél. Két szintre bontja:

Nate 5 alapelve: (1) discovery várakozás — a prompt designolja, merre “túr” az agent; (2) forrás-monitoring és időbeli drift; (3) prompt-injection biztonsági feltételezés MCP-szervereken; (4) decision accuracy mint elsődleges metrika a klasszikus precision/recall helyett; (5) prompt-versioning kötelező.

A jelentős átkeretezés: az eval-harness új generációja a probabilisztikus kontextus minőségére kell tervezzen — forrás-aggregáció, source-relevance scoring, drift-detekció — “precision and recall implicitly assume a deterministic context window, and you don’t necessarily have that anymore”.

Latent Space — Noam Brown arról, mit mos el a skálázás

A június 19-i Latent Space epizód Noam Brown-nal beszél (OpenAI, ex-Meta FAIR, Cicero diplomácia-bot, o-sorozat reasoning). Három pont különösen nyugtalanítóan releváns egy 2025-ben építő mérnök-csapatnak:

A router elmúlik. A dual-mode router (gyors válasz vs. mély reasoning) Anthropic-mintázat ma — Brown viszont kimondja: az OpenAI egy egyesített modell felé halad, ami magában dönti el. “In that world you shouldn’t need a router on top of the model.” Rövid távon hasznos, de 6-12 hónapra építeni rá az enterprise-stacket veszélyes.

A scaffold elmúlik. “Before reasoning models emerged, there was all this work that went into engineering agentic systems that made a lot of calls to GPT-4o to get reasoning behavior. Then it turned out: oh, we just created reasoning models, and you don’t need this complex behavior.” Brown tanácsa: ha 6 hónap alatt épülő scaffoldot tervezel, kérdezd meg, melyik komponense fog 6 hónap múlva eltörlődni.

Harness-mentesség mint cél. Pokémon-játszó o3-példán illusztrálja: az ideális harness a no-harness. Az iparban gyakran fordítva csinálják: ha a model nem teljesít, harness-szel feldopolják — Brown ezt technical debt-ként kezeli.

A közös szál: a “modell-független mérnöki réteg” (verifier, eval-harness, RFT-data-gyűjtés) sokkal stabilabb beruházás, mint a modell-pillanatkép-függő scaffoldok.

Apróbb hírek a hétről

Mit viszünk magunkkal

A hét három mérnöki / IT-vezetői kérdést hagy ott:

  1. A multi-agent-architektúra explicit ROI-számolás. A Cognition–Anthropic-vita azért érdekes, mert mindkét oldal igaza van — eltérő feladatokra. Open-ended kutatás megéri a 15× tokent; egy tight-context-coding-feladat jellemzően nem. Mielőtt multi-agent mellett dönt egy projekt, érdemes megválaszolni: a feladat verifikálható? a token-költség 10-15× feléri? a csapat érti a context-sharing-et? Ha bármelyikre nem, single-agent + verifier-réteg az olcsóbb és stabilabb választás.
  2. Az MCP-mintázat felé érdemes fejlődni. Még ha nem is most kapcsolod be a stackedet MCP-szerver-formában, a tool-szerződés-első-tervezés — világos signature, dokumentált error-state, idempotens hívás-séma — közvetlenül az MCP-pattern-ből építhető, és a saját agent-stackedet is olvashatóbbá teszi. Egy belső eszköz-adapter MCP-szerver-formában ma már Claude Desktop, Cursor, Windsurf-environmentben hozzáférhető.
  3. A context engineering az új eval-frontvonal. A gyakorlati teendő: a saját AI-stack-eden szét kell választani a determinisztikus és a probabilisztikus kontextust. Az előbbin (rules, system prompt, RAG) a klasszikus eval marad. Az utóbbin (web-search, MCP, autonóm tool-call) forrás-relevance-scoring és source-drift-monitoring kell. Ez egybecseng a SET-féle external verifier tézissel: a verifikáció nem a modell-output szintjén él, hanem a teljes context+output-tuple szintjén.

A W26-ban OpenAI o3-pro-elemzések, Meta Behemoth halasztás-rumor, és további MCP-registry-API-részletek várhatóak.

Források

Fő forrás — Nate B Jones csatornája:

Primer forrás — Anthropic hivatalos:

Körbejárás / tech-mélység — Latent Space podcast:

Fact-check és hivatkozott eredeti források:


A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.