Heti AI-hírlevél · ITLine

2025-W14   2025-03-31 — 2025-04-06   ·   8 forrás

W14 — Az MCP-ökoszisztéma beérik, az OpenAI open-weight felé fordul, és a Ghibli-hullám

Az Anthropic MCP-alkotói részletesen elmondják a protokoll-tervezési döntéseket, az OpenAI bejelenti az első open-weight reasoning modellt 2019 óta, az Augment Code az élre kerül a SWE-bench Verified-en, és a GPT-4o image-ből Ghibli-hullám lesz.

Kép helye — Bal oldalt egy USB-C-szerű csatlakozó-szimbólum ‘MCP’ címkével, jobb oldalt egy nyitott zárral ‘open-weight’ felirat, alul egy Ghibli-stílusú aquarell-ecsetvonás

A hét két érettségi-jelet és egy kulturális hullámot hoz. Egyfelől a Latent Space podcast április 3-án egy 80 perces beszélgetést ad ki David Soria Parra és Justin Spahr-Summers anthropikus mérnökökkel — ők ketten az MCP (Model Context Protocol) alkotói, és most először mondják el részletesen a tervezési döntéseket. Az interjú azért időzítés-fontos, mert az MCP ezekben a hetekben vált hivatalos szabványból tényleges iparági alapinfrastruktúrává — a W12-ben Cloudflare durable agents, most a Latent Space-en az Augment Code SWE-bench #1-es agentje is MCP-alapokon nyugszik. Másfelől Sam Altman március 31-én bejelenti: az OpenAI GPT-2 óta először kiad egy open-weight, reasoning-képes modellt — ez stratégiai irányváltás a W11-es closed-source agresszív irány után. És végül: a hét előtt egy nappal kiadott GPT-4o native image-modul berobbantja a “Studio Ghibli-stílusú családi fotó” trendet — Sam Altman maga is ghiblisre cseréli a profilképét, és a hét egyik signature-jelensége ez a kulturális hullám lesz. A három szál közös szála: 2025 áprilisban az AI-stack három rétegben — protokoll, modell-elérhetőség, kreatív felület — egyszerre érik be.

Az MCP-alkotók beszélnek — mit mond David és Justin

A Latent Space-epizódban Soria Parra és Spahr-Summers olyan részleteket mond el a protokoll-tervezésről, amelyeket eddig csak a kódból lehetett kiolvasni. Pár konkrét, mérnöki szempontból direkt hasznos pont:

Az eredet egy frusztrált fejlesztő. David 2024 júliusában kezdett az Anthropic-on belső dev-tooling-on dolgozni. “On one hand I have Claude Desktop with artifacts, on the other hand I work in IDE that can act on the file system” — és ezeket egymásba másolgatta. Közben az LSP-vel (Language Server Protocol) is bíbelődött. Két dolog egy fejben + pár hét várakozás = “let’s build a protocol”. Justin “tényleg csak rákattant” az ötletre, és másfél hónapnyi földmunka után megvolt az első proof-of-concept Claude Desktopban és a Zed editorban. A novemberi hivatalos kiadás előtt egy hónappal egy belső hackathonon valaki egy 3D-printert vezérelt MCP-vel — “that really added some juice”. A tanulság: a működő iparági szabványok ritkán nagy stratégiai mozdulatok eredményei. Ez egy két ember által, oldalprojektként indított “scratch your own itch”-ből nőtt ki.

Az LSP-mintát kifejezetten követték — beleértve a kritikákat. Az MCP JSON-RPC alapú, kétirányú, szándékosan unalmas. “In a lot of the core pieces you want to be boring” — a JSON-RPC nem tervezési innováció, hanem stabil alap, amire fókuszálni lehet. Az innováció a primitívekben van: tools, resources, prompts (és újabban sampling). A legfontosabb design-elv: mindent az alkalmazásfejlesztő perspektívájából tervez, nem a modell-perspektívából. “Tools are model-controlled, but resources and prompts can be application- or user-controlled.” Egy databázis-séma listázás például resource-ként sokkal jobb, mint tool-ként, mert a felhasználó vagy az alkalmazás dönti el, hogy mikor pakolja a context-be — nem a modell.

A Sentry-példa. David konkrét érve a prompts primitívről: az első Zed-implementáció prompt-alapú volt, nem tool-alapú. Egy MCP-szerver, ami egy Sentry-back-trace-t pakol be a context-be, felhasználói akcióra indul (slash-command, “/sentry trace 42”), nem modell-akcióra. “The very first implementation in Zed is actually a prompt implementation.” Ez sok jelenlegi MCP-szerver-fejlesztő számára meglepő — a többség mindent tool-call-ba pakol, miközben a felhasználó-vezérelt context-betoldás külön primitívre érdemes.

MCP vs. OpenAPI. Erre direkt rákérdez Swyx, és Justin kimondja: “OpenAPI specifications are too granular for what you want to do with LLMs. They don’t express higher-level AI-specific concepts.” Az OpenAPI stateless rest-API kontraktus, az MCP-ben szándékos állapotosság van — mert “AI applications and AI interactions will become inherently more stateful”. Multimodalitás (videó, hang) és hosszú-futású session-ök statelessen nehezen modellezhetőek. A két dolog komplementer: ahol már van OpenAPI-spec, közösségi bridge-ek (OpenAPI → MCP fordítók) léteznek; ahol új AI-first integrációt építesz, ott az MCP a megfelelő szint.

Composability és “MCP-szerver, ami egyben kliens is”. A W12-ben tárgyalt Cloudflare-féle durable-agent-ekhez közvetlenül kapcsolódó téma: az MCP-szerverek rekurzívan láncolhatóak. Egy szerver lehet egy másik szerver kliense, és így DAG-szerű agent-gráfok építhetőek MCP-blokkokból. “Is that an agent? There’s a lot of definitions of agent…” — Justin direkt nem akarja eldönteni, hogy ez meddig MCP-feladat és hol kezdődik egy külön agent-protokoll. Mérnöki szempontból ez nyitott kérdés: ha az MCP minden agent-funkciót magába olvaszt, “god box”-szá válik és romlik. Ha túl szigorúan korlátozzák, akkor felüle más szabványok jönnek (lásd Google A2A, amiről a következő hét lesz).

Az OpenAI open-weight irányba fordul

Sam Altman március 31-i X-poszta kimondja: “we are excited to release a powerful new open-weight language model with reasoning in the coming months” — és ez 2019, a GPT-2 óta az első. A bejelentés-anyag szerint a modell “o3-mini-szintű reasoning”-ot céloz, és nyár-felé érkezhet. Az OpenAI fejlesztői feedback-formot is publikál, és San Francisco-i, európai, ázsiai dev-eseményeket szervez köré.

Stratégiai értelmezés. Nate B Jones a április 2-i videójában szkeptikus. Három pontja:

  1. Az ökoszisztéma-bizalom kérdés. A Llama (Meta), DeepSeek és a folyamatos open-source kiadások éveken át építették a fejlesztői bizalmat. Az OpenAI most jön — nem azért, mert ezt akarta, hanem mert “the ship has sailed” a versenyben. Egy fejlesztő, aki egy stack-re fog ráépíteni, a karbantartási folyamatosság alapján választ, nem egy bejelentés alapján. Az OpenAI esetében ez a karbantartási bizalom hiányzik.
  2. A “product surface” különbség. Nate megfigyelése: a Claude azért nyert kódolásban, mert a Cursor-Claude pozitív flywheel kiépült — Cursor adoption hajtja Claude adoption-t és vissza. Az Anthropic nem nyitott modelt csinál, hanem MCP-t csinál, és így anchoröli az ökoszisztémát. Az OpenAI nem építette ezt a felületet open-source-ban — egy bejelentéssel ezt nem lehet bepótolni.
  3. A binary-pendulum. Az OpenAI vagy $300 milliárdos for-profit (most ott van), vagy mély open-source elköteleződés (Meta, DeepSeek vannak ott). “You can’t straddle the fence” — egyszerre mindkettő nem hihető. A Reddit-AMA, ahol Altman *“on the wrong side of history”-t mondta a corporate strategy-re, fél-marketing-fél-mea-culpa, de a vállalati ösztönzők a closed-source felé húzzák.

Mi viszont ettől friss. Az open-weight-bejelentés technikai stop-jelet tesz: ha az OpenAI publikál egy o3-mini-szintű reasoning-modellt szabadon futtathatóan, az on-prem deployment narratíva (európai compliance-fókuszú vásárlóknak) drasztikusan javul. A SET-szempontból ez érdekes: a két-sávos on-prem/cloud-üzenet mostantól nem csak Llama-Mistral-DeepSeek-alapú, hanem OpenAI-alapú on-prem is opció lehet — ha a kiadás megtörténik, és ha a méret/HW-igény kezelhető marad.

Augment Code: SWE-bench Verified #1, off-the-shelf modellekkel

A Latent Space április 2-i Augment-epizódjában Guy Gur-Ari (Augment, ex-Google) bejelenti: az ő SWE-bench Verified agent-implementációjuk 65,4%-os success-rate-tel elérte az #1-es helyet az open-source ranglistán — és nyílt forráskódban kiadták. A VentureBeat összefoglalója szerint ez 70%-os win-rate-tet jelent GitHub Copilot ellen.

Mérnöki szempontból a podcast tanulságai konkrétak:

Off-the-shelf modellek + smart orchestration > custom-trained. A generációs modellek mind off-the-shelf — Claude Sonnet 3.7 mint core-driver és OpenAI o1 mint ensembler. Custom-trained modelljük csak a codebase-megértésben van. “For now, building a product and going to market quickly, this is what we’ve prioritized.” A tanulság: 2025-ben a koding-agent-piacon a stack-architektúra (multi-cloud, multi-model, ensembling, sequential-thinking-MCP) jobban hozza a benchmark-eredményt, mint az egyéni modell-tréning.

Sequential-thinking MCP > reasoning-mode. Konkrét meglepetés: a Sonnet 3.7 reasoning-mode-ja nem hozta a benchmark-bumpot. A sequential-thinking MCP-szerver (egy Anthropic-féle közösségi build, ami lépésről-lépésre reflexiót ad a modellnek) jobb eredményt hozott, mint a beépített reasoning. Guy nem tudja, miért — “I don’t have a good insight for that”. De ez egy direkt példa az MCP-érettségre: a tool-szintű reflexió-réteg externalizálható és komponálható, és bizonyos benchmark-okon jobb, mint a modell-belső reasoning.

Ensembling: pár százalékpont, de UX-probléma. Több futtatás → többségi szavazás → még pár pp. De “users really want to see what the agent is doing and follow along” — ha párhuzamosan fut három agent, hogyan mutatod a userselnek? Cost-szempontból ez ma még drága; UX-szempontból ez egy nyitott design-probléma.

“Orientation phase”. Mielőtt a kódhoz nyúlna az agent, az Augment-product körülnéz a codebase-ben: milyen tesztrunner, milyen framework, milyen verziók, milyen konvenciók. Ez 2025-ben egy general agent-pattern: a végrehajtás előtti context-akvizíció ugyanannyira kritikus, mint a tényleges edit-fázis. SET-szempontból: a verifier-réteghez ugyanez vonatkozik — az automata-teszteknek tudniuk kell, milyen testrunner van a projektben, mielőtt futtatnák.

A GPT-4o image-hullám és a Ghibli-fenomén

Március 25-én az OpenAI kiadta a GPT-4o native image-generációs modulját — autoregresszív (token-by-token, nem diffusion), és a whitex.ai elemzése szerint drasztikusan jobb prompt-adherence-t és szövegrenderelést produkál. A hét legnagyobb kulturális AI-jelensége az, hogy a Studio Ghibli-stílusú családi fotó trend berobbant: Sam Altman saját profilképét is ghiblisre cseréli, és Peter Yang április 2-i összefoglalója öt konkrét use-case-en mutatja meg a praktikus erőt — családi fotó-átstílusozás, marketing-asset-mockup, infografika-újrarajzolás, YouTube-thumbnail-szerkesztés, anime-rövidfilm.

A TechCrunch jelzése szerint a kiadás akkora rohamot indított, hogy a free-tier-rollout késett, és Altman maga jelezte: “GPUs are melting”. Egy óra alatt 1 millió új signup. Mérnöki kontextusban Nate az április 1-i benchmark-videójában megjegyzi: az ő strukturált 8-9 prompt-os tesztsorán mérhetően jobb prompt-adherence-t kapott a GPT-4o image-től, mint a Gemini-től. Az autoregresszív + on-the-fly prompt-expansion kombináció (a kiszivárgott system-prompt szerint a 4o kibontja a felhasználó utasítását képgenerálás előtt) érzékelhetően közelebb hozza a kimenetet a felhasználó szándékához.

Mellékszál — rovatok

Mit viszünk magunkkal

A hét három mérnöki / vezetői kérdést hagy ott:

  1. Az MCP nem opció többé, hanem alapinfrastruktúra. A Latent Space-MCP-creators-interjú, az Augment-Code-SWE-bench-1-nyertes (sequential-thinking MCP-vel), és a W12-es Cloudflare durable-agent-szegmens együtt egyértelművé teszi: ha 2025-ben enterprise-AI-stack-et tervezel és nem az MCP a tool-protokollod, akkor kívül vagy az ökoszisztémán. Konkrét lépés: nézd meg, hogy a meglévő tool-szerződéseidet (REST-API, gRPC, custom JSON) MCP-kompatibilis bridge-en elérhetővé tudod-e tenni — ez már kis befektetéssel megnyitja az összes nagy IDE-t és agent-keretet (Cursor, Cline, Zed, Claude Desktop, Augment).

  2. Off-the-shelf modellek + smart orchestration vs. custom-tréning. Az Augment Sonnet 3.7 + o1 kombináció bizonyítja: 2025-ben a benchmark-#1 nem custom-modell-tréningből jön, hanem multi-model, multi-cloud orchestrationből. Saját stack-tervezésnél érdemes megnézni: a kódolási / agent-feladatokon két különböző provider-modell (Claude + OpenAI; Claude + Gemini; OpenAI + DeepSeek) ensemble-je mérhetően jobb lehet, mint egy modell-fókusz. SET-implikáció: a verifier-réteg modell-független kell legyen, hogy az ensemble-pattern alkalmazható maradjon.

  3. Verifier nélküli LLM-output makro-skálán is veszélyes. A tariff-incidens nem mérnöki kuriózum — egy konkrét USA-policy, ami billió-dolláros piacmozgást generált. Az LLM-output policy-szintű döntésnél tartalmi verifier nélkül elkerülhetetlenül elcsúszik. A SET-tézis (“külső verifier-réteg agent-output mellett”) most policy-makro-skálán is alátámasztott — és ez egy ritka, drága, de tanulságos eset. Saját stack-en érdemes megnézni: van-e bárhol olyan LLM-output, amit ember-jóváhagyás nélkül továbbít a rendszer egy magas-tét döntésbe? Ha igen, ott azonnali audit-réteg kell.

A W15-ben várhatóan: a Llama 4 kiadás (Meta), a Google A2A protokoll (agent-to-agent kommunikáció — direkt MCP-versengés), és Hugging Face Q1-es agent-leaderboard.

Források

Fő forrás — Nate B Jones csatornája:

Körbejárás / tech-mélység — Latent Space podcast:

Plus — Peter Yang:

Fact-check és hivatkozott eredeti források:


A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.