A hét két érettségi-jelet és egy kulturális hullámot hoz. Egyfelől a Latent Space podcast április 3-án egy 80 perces beszélgetést ad ki David Soria Parra és Justin Spahr-Summers anthropikus mérnökökkel — ők ketten az MCP (Model Context Protocol) alkotói, és most először mondják el részletesen a tervezési döntéseket. Az interjú azért időzítés-fontos, mert az MCP ezekben a hetekben vált hivatalos szabványból tényleges iparági alapinfrastruktúrává — a W12-ben Cloudflare durable agents, most a Latent Space-en az Augment Code SWE-bench #1-es agentje is MCP-alapokon nyugszik. Másfelől Sam Altman március 31-én bejelenti: az OpenAI GPT-2 óta először kiad egy open-weight, reasoning-képes modellt — ez stratégiai irányváltás a W11-es closed-source agresszív irány után. És végül: a hét előtt egy nappal kiadott GPT-4o native image-modul berobbantja a “Studio Ghibli-stílusú családi fotó” trendet — Sam Altman maga is ghiblisre cseréli a profilképét, és a hét egyik signature-jelensége ez a kulturális hullám lesz. A három szál közös szála: 2025 áprilisban az AI-stack három rétegben — protokoll, modell-elérhetőség, kreatív felület — egyszerre érik be.
Az MCP-alkotók beszélnek — mit mond David és Justin
A Latent Space-epizódban Soria Parra és Spahr-Summers olyan részleteket mond el a protokoll-tervezésről, amelyeket eddig csak a kódból lehetett kiolvasni. Pár konkrét, mérnöki szempontból direkt hasznos pont:
Az eredet egy frusztrált fejlesztő. David 2024 júliusában kezdett az Anthropic-on belső dev-tooling-on dolgozni. “On one hand I have Claude Desktop with artifacts, on the other hand I work in IDE that can act on the file system” — és ezeket egymásba másolgatta. Közben az LSP-vel (Language Server Protocol) is bíbelődött. Két dolog egy fejben + pár hét várakozás = “let’s build a protocol”. Justin “tényleg csak rákattant” az ötletre, és másfél hónapnyi földmunka után megvolt az első proof-of-concept Claude Desktopban és a Zed editorban. A novemberi hivatalos kiadás előtt egy hónappal egy belső hackathonon valaki egy 3D-printert vezérelt MCP-vel — “that really added some juice”. A tanulság: a működő iparági szabványok ritkán nagy stratégiai mozdulatok eredményei. Ez egy két ember által, oldalprojektként indított “scratch your own itch”-ből nőtt ki.
Az LSP-mintát kifejezetten követték — beleértve a kritikákat. Az MCP JSON-RPC alapú, kétirányú, szándékosan unalmas. “In a lot of the core pieces you want to be boring” — a JSON-RPC nem tervezési innováció, hanem stabil alap, amire fókuszálni lehet. Az innováció a primitívekben van: tools, resources, prompts (és újabban sampling). A legfontosabb design-elv: mindent az alkalmazásfejlesztő perspektívájából tervez, nem a modell-perspektívából. “Tools are model-controlled, but resources and prompts can be application- or user-controlled.” Egy databázis-séma listázás például resource-ként sokkal jobb, mint tool-ként, mert a felhasználó vagy az alkalmazás dönti el, hogy mikor pakolja a context-be — nem a modell.
A Sentry-példa. David konkrét érve a prompts primitívről: az első Zed-implementáció prompt-alapú volt, nem tool-alapú. Egy MCP-szerver, ami egy Sentry-back-trace-t pakol be a context-be, felhasználói akcióra indul (slash-command, “/sentry trace 42”), nem modell-akcióra. “The very first implementation in Zed is actually a prompt implementation.” Ez sok jelenlegi MCP-szerver-fejlesztő számára meglepő — a többség mindent tool-call-ba pakol, miközben a felhasználó-vezérelt context-betoldás külön primitívre érdemes.
MCP vs. OpenAPI. Erre direkt rákérdez Swyx, és Justin kimondja: “OpenAPI specifications are too granular for what you want to do with LLMs. They don’t express higher-level AI-specific concepts.” Az OpenAPI stateless rest-API kontraktus, az MCP-ben szándékos állapotosság van — mert “AI applications and AI interactions will become inherently more stateful”. Multimodalitás (videó, hang) és hosszú-futású session-ök statelessen nehezen modellezhetőek. A két dolog komplementer: ahol már van OpenAPI-spec, közösségi bridge-ek (OpenAPI → MCP fordítók) léteznek; ahol új AI-first integrációt építesz, ott az MCP a megfelelő szint.
Composability és “MCP-szerver, ami egyben kliens is”. A W12-ben tárgyalt Cloudflare-féle durable-agent-ekhez közvetlenül kapcsolódó téma: az MCP-szerverek rekurzívan láncolhatóak. Egy szerver lehet egy másik szerver kliense, és így DAG-szerű agent-gráfok építhetőek MCP-blokkokból. “Is that an agent? There’s a lot of definitions of agent…” — Justin direkt nem akarja eldönteni, hogy ez meddig MCP-feladat és hol kezdődik egy külön agent-protokoll. Mérnöki szempontból ez nyitott kérdés: ha az MCP minden agent-funkciót magába olvaszt, “god box”-szá válik és romlik. Ha túl szigorúan korlátozzák, akkor felüle más szabványok jönnek (lásd Google A2A, amiről a következő hét lesz).
Az OpenAI open-weight irányba fordul
Sam Altman március 31-i X-poszta kimondja: “we are excited to release a powerful new open-weight language model with reasoning in the coming months” — és ez 2019, a GPT-2 óta az első. A bejelentés-anyag szerint a modell “o3-mini-szintű reasoning”-ot céloz, és nyár-felé érkezhet. Az OpenAI fejlesztői feedback-formot is publikál, és San Francisco-i, európai, ázsiai dev-eseményeket szervez köré.
Stratégiai értelmezés. Nate B Jones a április 2-i videójában szkeptikus. Három pontja:
- Az ökoszisztéma-bizalom kérdés. A Llama (Meta), DeepSeek és a folyamatos open-source kiadások éveken át építették a fejlesztői bizalmat. Az OpenAI most jön — nem azért, mert ezt akarta, hanem mert “the ship has sailed” a versenyben. Egy fejlesztő, aki egy stack-re fog ráépíteni, a karbantartási folyamatosság alapján választ, nem egy bejelentés alapján. Az OpenAI esetében ez a karbantartási bizalom hiányzik.
- A “product surface” különbség. Nate megfigyelése: a Claude azért nyert kódolásban, mert a Cursor-Claude pozitív flywheel kiépült — Cursor adoption hajtja Claude adoption-t és vissza. Az Anthropic nem nyitott modelt csinál, hanem MCP-t csinál, és így anchoröli az ökoszisztémát. Az OpenAI nem építette ezt a felületet open-source-ban — egy bejelentéssel ezt nem lehet bepótolni.
- A binary-pendulum. Az OpenAI vagy $300 milliárdos for-profit (most ott van), vagy mély open-source elköteleződés (Meta, DeepSeek vannak ott). “You can’t straddle the fence” — egyszerre mindkettő nem hihető. A Reddit-AMA, ahol Altman *“on the wrong side of history”-t mondta a corporate strategy-re, fél-marketing-fél-mea-culpa, de a vállalati ösztönzők a closed-source felé húzzák.
Mi viszont ettől friss. Az open-weight-bejelentés technikai stop-jelet tesz: ha az OpenAI publikál egy o3-mini-szintű reasoning-modellt szabadon futtathatóan, az on-prem deployment narratíva (európai compliance-fókuszú vásárlóknak) drasztikusan javul. A SET-szempontból ez érdekes: a két-sávos on-prem/cloud-üzenet mostantól nem csak Llama-Mistral-DeepSeek-alapú, hanem OpenAI-alapú on-prem is opció lehet — ha a kiadás megtörténik, és ha a méret/HW-igény kezelhető marad.
Augment Code: SWE-bench Verified #1, off-the-shelf modellekkel
A Latent Space április 2-i Augment-epizódjában Guy Gur-Ari (Augment, ex-Google) bejelenti: az ő SWE-bench Verified agent-implementációjuk 65,4%-os success-rate-tel elérte az #1-es helyet az open-source ranglistán — és nyílt forráskódban kiadták. A VentureBeat összefoglalója szerint ez 70%-os win-rate-tet jelent GitHub Copilot ellen.
Mérnöki szempontból a podcast tanulságai konkrétak:
Off-the-shelf modellek + smart orchestration > custom-trained. A generációs modellek mind off-the-shelf — Claude Sonnet 3.7 mint core-driver és OpenAI o1 mint ensembler. Custom-trained modelljük csak a codebase-megértésben van. “For now, building a product and going to market quickly, this is what we’ve prioritized.” A tanulság: 2025-ben a koding-agent-piacon a stack-architektúra (multi-cloud, multi-model, ensembling, sequential-thinking-MCP) jobban hozza a benchmark-eredményt, mint az egyéni modell-tréning.
Sequential-thinking MCP > reasoning-mode. Konkrét meglepetés: a Sonnet 3.7 reasoning-mode-ja nem hozta a benchmark-bumpot. A sequential-thinking MCP-szerver (egy Anthropic-féle közösségi build, ami lépésről-lépésre reflexiót ad a modellnek) jobb eredményt hozott, mint a beépített reasoning. Guy nem tudja, miért — “I don’t have a good insight for that”. De ez egy direkt példa az MCP-érettségre: a tool-szintű reflexió-réteg externalizálható és komponálható, és bizonyos benchmark-okon jobb, mint a modell-belső reasoning.
Ensembling: pár százalékpont, de UX-probléma. Több futtatás → többségi szavazás → még pár pp. De “users really want to see what the agent is doing and follow along” — ha párhuzamosan fut három agent, hogyan mutatod a userselnek? Cost-szempontból ez ma még drága; UX-szempontból ez egy nyitott design-probléma.
“Orientation phase”. Mielőtt a kódhoz nyúlna az agent, az Augment-product körülnéz a codebase-ben: milyen tesztrunner, milyen framework, milyen verziók, milyen konvenciók. Ez 2025-ben egy general agent-pattern: a végrehajtás előtti context-akvizíció ugyanannyira kritikus, mint a tényleges edit-fázis. SET-szempontból: a verifier-réteghez ugyanez vonatkozik — az automata-teszteknek tudniuk kell, milyen testrunner van a projektben, mielőtt futtatnák.
A GPT-4o image-hullám és a Ghibli-fenomén
Március 25-én az OpenAI kiadta a GPT-4o native image-generációs modulját — autoregresszív (token-by-token, nem diffusion), és a whitex.ai elemzése szerint drasztikusan jobb prompt-adherence-t és szövegrenderelést produkál. A hét legnagyobb kulturális AI-jelensége az, hogy a Studio Ghibli-stílusú családi fotó trend berobbant: Sam Altman saját profilképét is ghiblisre cseréli, és Peter Yang április 2-i összefoglalója öt konkrét use-case-en mutatja meg a praktikus erőt — családi fotó-átstílusozás, marketing-asset-mockup, infografika-újrarajzolás, YouTube-thumbnail-szerkesztés, anime-rövidfilm.
A TechCrunch jelzése szerint a kiadás akkora rohamot indított, hogy a free-tier-rollout késett, és Altman maga jelezte: “GPUs are melting”. Egy óra alatt 1 millió új signup. Mérnöki kontextusban Nate az április 1-i benchmark-videójában megjegyzi: az ő strukturált 8-9 prompt-os tesztsorán mérhetően jobb prompt-adherence-t kapott a GPT-4o image-től, mint a Gemini-től. Az autoregresszív + on-the-fly prompt-expansion kombináció (a kiszivárgott system-prompt szerint a 4o kibontja a felhasználó utasítását képgenerálás előtt) érzékelhetően közelebb hozza a kimenetet a felhasználó szándékához.
Mellékszál — rovatok
Anthropic — benchmark-rethinking-paper. Nate az április 1-i videójában egy új Anthropic-paperre hivatkozik, amely amellett érvel, hogy a “model evaluation” mint single-score szemlélet elavult. Helyette kontinuumokat javasol: hallucináció vs. igazság, pattern-matching vs. multi-step thought, autonómia-skála, robustness, computational efficiency. “The test scores are useless” — a 150-pontos AIM-szám már overfitált. A SET-implikáció direkt: a verifier-tervezésnél is több-dimenziós minőségi metrika szükséges, nem egy single pass/fail.
Gemini 2.5 Pro — March 25. Google a március 25-i bejelentésében kiadja a Gemini 2.5 Pro-t, 18,8% Humanity’s Last Exam, 86,7% AIME 2025, 84% GPQA Diamond — sok benchmark-on élre kerül. A Latent Space Augment-epizódjában Guy is ezt mondja: “by some accounts it’s one of the best models in the world. It is the best model in the world.” Az Anthropic-Cursor-flywheel mellett megjelenik egy Google-flywheel is — ez 2025 második negyedévében formázza meg a verseny-térképet.
Claude Plays Pokémon. A Latent Space április 5-i hackathon-szegmensében David Hershey (Anthropic) elmeséli a Claude Pokemon-evaluation-projekt evolúcióját. A legfontosabb mérnöki tanulság: a vision-réteg gyenge. A 8 órás “A-gomb-nyomkodás-szőnyegre-mert-azt-hiszi-dialog-box” anekdota mögött komoly insight van: a Claude a játék-screenek értelmezésében drasztikusan rosszabb, mint a természetes-kép-értelmezésben. Spatial-reasoning, relatív-pozíció-megértés még megoldatlan probléma. Plus David konkrét prompt-tanulság: adj nevet a Pokémonoknak — a Claude jobban vigyáz a megnevezett karakterekre. Ez vicces, de mérnöki: a tool-leírás és a context-elnevezés nem semleges, érzékelhető minőségi különbséget okoz.
Misalignment-Bingo: AI-vezérelt tariff-formula. Április 2-án Trump bejelenti a “reciprocal tariffs”-t. Nate az április 4-i videójában hivatkozik James Surowiecki közgazdász és Krishnan Rohit AI-kutató független megfigyeléseire: a hivatalos formula = (trade-deficit / total-imports) / 2. Pontosan ezt a formulát adja vissza Claude 3.7, ChatGPT, Grok és Gemini, ha azt kérdezed tőle, hogyan számoljon “easy reciprocal tariffs”-t. Ez zero közgazdász ajánlása — a “trade-imbalance” nem reciprocal-tariff-bázis. Második jel: a tarifa-listán szerepel a Heard and McDonald Islands (lakatlan, csak pingvinek) — saját top-level domain (.hm), nem ország. LLM-szignatúra: top-level-domain-listából generált entitás-lista. “It’s the first case where arguably a misaligned AI caused an economic crisis” (Nate). A tanulság: ha verifier nélkül engedsz LLM-output-ot policy-szintű döntésbe, a misalignment makro-skálán jelenik meg.
Mit viszünk magunkkal
A hét három mérnöki / vezetői kérdést hagy ott:
Az MCP nem opció többé, hanem alapinfrastruktúra. A Latent Space-MCP-creators-interjú, az Augment-Code-SWE-bench-1-nyertes (sequential-thinking MCP-vel), és a W12-es Cloudflare durable-agent-szegmens együtt egyértelművé teszi: ha 2025-ben enterprise-AI-stack-et tervezel és nem az MCP a tool-protokollod, akkor kívül vagy az ökoszisztémán. Konkrét lépés: nézd meg, hogy a meglévő tool-szerződéseidet (REST-API, gRPC, custom JSON) MCP-kompatibilis bridge-en elérhetővé tudod-e tenni — ez már kis befektetéssel megnyitja az összes nagy IDE-t és agent-keretet (Cursor, Cline, Zed, Claude Desktop, Augment).
Off-the-shelf modellek + smart orchestration vs. custom-tréning. Az Augment Sonnet 3.7 + o1 kombináció bizonyítja: 2025-ben a benchmark-#1 nem custom-modell-tréningből jön, hanem multi-model, multi-cloud orchestrationből. Saját stack-tervezésnél érdemes megnézni: a kódolási / agent-feladatokon két különböző provider-modell (Claude + OpenAI; Claude + Gemini; OpenAI + DeepSeek) ensemble-je mérhetően jobb lehet, mint egy modell-fókusz. SET-implikáció: a verifier-réteg modell-független kell legyen, hogy az ensemble-pattern alkalmazható maradjon.
Verifier nélküli LLM-output makro-skálán is veszélyes. A tariff-incidens nem mérnöki kuriózum — egy konkrét USA-policy, ami billió-dolláros piacmozgást generált. Az LLM-output policy-szintű döntésnél tartalmi verifier nélkül elkerülhetetlenül elcsúszik. A SET-tézis (“külső verifier-réteg agent-output mellett”) most policy-makro-skálán is alátámasztott — és ez egy ritka, drága, de tanulságos eset. Saját stack-en érdemes megnézni: van-e bárhol olyan LLM-output, amit ember-jóváhagyás nélkül továbbít a rendszer egy magas-tét döntésbe? Ha igen, ott azonnali audit-réteg kell.
A W15-ben várhatóan: a Llama 4 kiadás (Meta), a Google A2A protokoll (agent-to-agent kommunikáció — direkt MCP-versengés), és Hugging Face Q1-es agent-leaderboard.
Források
Fő forrás — Nate B Jones csatornája:
- 2025-04-01 · Rethinking AI Benchmarks: New Anthropic Paper Shows One-Size Doesn’t Work — kontinuum-alapú modell-evaluation, single-score-overfit-kritika.
- 2025-04-02 · OpenAI Gambles on Open-Source, but Claude, Meta, and DeepSeek are Better Positioned — open-weight-bejelentés stratégiai elemzés, product-surface-érv.
- 2025-04-03 · We Need a New Computing Paradigm for AI — rövid filozófiai esszé az AI-megértés-szótárról.
- 2025-04-04 · Misalignment Bingo: AI (almost certainly) helped crash the economy — tariff-formula LLM-szignatúrái.
Körbejárás / tech-mélység — Latent Space podcast:
- 2025-04-02 · The #1 SWE-Bench Verified Agent — Guy Gur-Ari (Augment Code) — 65,4% SWE-bench Verified, off-the-shelf-modellek, sequential-thinking-MCP, orientation-phase.
- 2025-04-03 · The Creators of Model Context Protocol — David Soria Parra & Justin Spahr-Summers — MCP-eredet, LSP-inspiráció, primitives (tools/resources/prompts), MCP vs. OpenAPI, composability.
- 2025-04-05 · Claude Plays Pokémon Hackathon — David Hershey (Anthropic) — agent-eval-stratégia, vision-gyenge-pont, named-character-effect.
Plus — Peter Yang:
- 2025-04-02 · ChatGPT’s New Image Model Changes Everything: 5 Use Cases — GPT-4o image gyakorlati workflow-k.
Fact-check és hivatkozott eredeti források:
- Sam Altman X-poszt — open-weight bejelentés (2025-03-31)
- Decrypt — OpenAI Plans to Release Open-Weight Model with Reasoning
- OpenAI — Introducing 4o Image Generation (2025-03-25)
- InfoQ — OpenAI Releases Improved Image Generation in GPT-4o
- Augment Code — #1 open-source agent on SWE-Bench Verified
- VentureBeat — Augment Code AI agent 70% win-rate over GitHub Copilot
- Google — Gemini 2.5 Pro release blog (2025-03-25)
- Decrypt — ‘Vibe Governing’: Trump’s Tariff Formula Eerily Similar to ChatGPT
- Newsweek — Did Trump Admin Use ChatGPT to Allocate Tariffs?
A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.