A hét egyetlen szóban foglalható össze: Super Week. Hétfőn Microsoft Build — Model Context Protocol natívan a Windowsban, GitHub Copilot autonóm coding agent. Kedd-szerda Google I/O — havi $250-os AI Ultra előfizetés, Gemini 2.5 Pro Deep Think mód, Project Mariner, AI mode a keresőben minden amerikai felhasználónak. Csütörtökön az Anthropic első saját fejlesztői konferenciája, Code with Claude, ahol megjelenik a Claude Opus 4 és Sonnet 4 — Opus a “world’s best coding model” címkével, SWE-bench 72.5%, Terminal-bench 43.2%. Plus a Latent Space két epizódot is hoz: DeepWiki (Cognition / Devon — AI-generált wiki bármely GitHub repóhoz) és Will Brown a Prime Intellect-ről (multi-turn RL agentekhez).
Nate B Jones május 20-i videójában megmagyarázza, miért torlódik mindez egy hétre: a május harmadik hete San Franciscóban hagyományosan jó idős, és a június már Apple WWDC. A többi modell-építő (OpenAI, Microsoft, Anthropic) rátelepszik Google IO-narratívájára, hogy ne maradjon le. Az enterprise oldalról ez 2026-os budgeting-ciklus — májusban szólni kell a vásárlókhoz, mire elkezdik a tervezést.
A közös szál: az “agent” szó már nem jövőkép, hanem a heti termékkiadások explicit fókusza — coding agent, browser agent, multi-step task agent. És minden szereplő órákban mér, nem percekben.
Microsoft Build — MCP mint OS-szintű primitive
A Microsoft Build keynote három olyan dolgot tett le, ami architektúrális választás, nem feature.
Egy: a Model Context Protocol (MCP) a Windows 11-be kerül. A jövőbeli Windows-update-ek a fájlkezelést, ablakkezelést és WSL-t MCP-szerverként exponálják. Nate keretezése a május 20-i videójában éles: “when Microsoft baked Model Context Protocol into Windows, that’s not just a feature announcement — they’re changing what happens automatically.” Vagyis: az opcionális protokollból default OS-primitive lett. Ez analóg azzal, mint amikor a Bluetooth bekerült a Windowsba — eddig külső adapter kellett, mostantól minden gép képes rá.
Kettő: GitHub Copilot autonóm coding agent. A GitHub bejelentése szerint az új agent GitHub-issue-t kap kiosztva, generál egy PR-t, és a felhasználói feedback alapján refaktorál. Listázott képességek: feature-hozzáadás, bug-fix, refaktor, doksi-javítás — well-tested codebase-eken. Ez utolsó megszorítás a fontos: a meta-üzenet az, hogy a tesztek a coding agent input-szerződésének része, nem opcionális dekoráció.
Három: a GitHub Copilot Chat-extension MIT-licensz alá kerül open source-ként, és fokozatosan beolvad a VS Code core-ba. Ez stratégiai válasz a Cursorra és a Windsurfre — Microsoft nem versenyez termékkel, stack-réteget kommodifikál.
A SET-szempontból a leglényegesebb: a “well-tested codebase” feltétel kimondja, hogy a teszt-coverage és a verifier-réteg a coding-agent stack előfeltétele. Ami ezzel egybeesik a W07-es Anthropic Building Effective Agents tanulságaival — a verifikálhatóság a sweet spot. Most ez konkrét termékkövetelménnyé lett.
Google I/O — három figyelő terület
Nate május 21-i Google I/O-elemzése hét takeaway-t nevez meg, ezek közül három mérnöki / üzleti szempontból tényleg fontos.
Egy: új ár-osztály — a “$250 AI subscription”. A Google AI Ultra havi $249.99 — a Gemini 2.5 Pro Deep Think, a Project Mariner agent (egyidejűleg 10 chained taszk), magasabb usage-cap-ek, YouTube Premium, 30TB tárhely. Az OpenAI ChatGPT Pro $200, így a high-end AI-előfizetés-réteg most $200–$250 sávon stabilizálódik. Nate metaforája: “this is past cable bill pricing”. Streaming-háború analógia: ahogy a Netflix és Disney+ konsolidált 2018–2020-ban, a felső AI-tier várhatóan ugyanúgy konszolidál — de több ember vesz egynél többet, mert a modellek nem 1:1 helyettesítik egymást.
Kettő: Deep Think mode = a model-osztályok újabb tisztulása. A Gemini 2.5 Pro Deep Think többi reasoning-mintázattal egy tészta: párhuzamosan több hipotézist tart fent, később választ. Ez a W17-es o3, W07-es deep reasoning kategória folytatása — a modellek többszintű inference-time compute-tal jönnek, és a fejlesztő választhat: “think harder?” toggle, vagy budget-paraméter. Ezzel összefügg a Latent Space epizód Will Brown-nal — erről alább.
Három: distribution mint védendő bottleneck — coherent vagy nem? Nate kérdezi: Google attakja a distributiont (Gemini Chrome-ban, Gmail-ben, Meet-ben, Workspace-ben, Android XR-ben mindenhol), de ez a saját bottleneckjük volt-e? Nate gyanúja: nem. A Google lemarad termék-koherenciában — “which Gemini do I get where? That is not a question you want still surfacing for consumers.” A flooding-the-zone stratégia fragmentációt szül, ha nincs egy product-zar, aki a brand-élményt egységesíti. Az Apple-WWDC közelség és a Cue Eddy nyilatkozata, hogy Google search-volume először esett 20 év óta áprilisban sürgető pressure — a Google védekezik, de defensive playbook-ja ráncos.
A SET-szempont: a Project Mariner típusú browser-agentek (10 chained task) most már nem demo, hanem subscription-feature. Ami ezzel kötelezővé teszi az enterprise-stack tervezésében az agent-trace audit-réteget — ha a felhasználó a saját Gemini-jével párhuzamosan hatféle taszkot futtat a céges adatokon, a megfigyelhetőség nem opcionális.
Anthropic — Claude 4 és a 7-órás autonom-kódolás
Csütörtökön az Anthropic első saját fejlesztői konferenciája, Code with Claude, és kijön a Claude Opus 4 és Sonnet 4. Hivatalos benchmark-számok: Opus 4 SWE-bench 72.5%, Terminal-bench 43.2%, Sonnet 4 SWE-bench 72.7% — mindkettő a coding-frontvonalra céloz. Az árazás stabil: Opus 4 $15/$75, Sonnet 4 $3/$15 (input/output, M tokenenként).
Nate május 23-i videójában korai Opus-hozzáférést tesztel, és néhány konkrét észrevétel:
Native integration mint UX-ugrás. Claude Opus 4 natívan integrált Gmail, Google Calendar, Google Drive. Nate egy próba-feladata: “build a custom briefing dashboard for tomorrow”. A W08 körüli Claude 3.7 ezt nem tudta — token-budget ki, search nem talált. Most Opus 4 180 másodperc alatt működő app-ot épített — calendar-conflict-detektálás, color-coded meetings, email-insights. “This is something that is going to have daily application for me.” A SET-szempontból az érdekes: az integrációk minősége modellteljesítmény-mérce, nem csak feature.
A “7-órás autonom-coding”-szám. Dario Amodei a launch-on említi, hogy belső testing során a Claude Opus 4 hét óráig dolgozott egy coding-feladaton önállóan és megoldotta. Ha ez stabilizálódik, az új rekord agent-független-munkára. Korábban a W04-es Devin, W05-ös Cline, W17-es o3 agent-loop-ok percekben mérhető önállóságot demoltak. A “hét óra” szám óriási alapanyag-bővülés: ha a modell ennyi ideig tud egy kontextusban koherensen dolgozni, akkor éjszakai batch-feladatok (refaktor, dependency-bump, test-coverage-bővítés) agent-friendly munkaformává válnak. Persze a szám valós-világi reprodukálhatósága még nyitott.
Reward-hacking visszaszorítása. Will Brown a Latent Space-en (május 23) konkrét számot említ: az Anthropic egy belső reward-hacking-benchmarken 45% → 15% csökkenést ért el a Claude 3.7 Sonnet-hez képest, mind Opus, mind Sonnet 4-en. Brown definíciója: “models are much more friendly to code with and maybe more trustworthy” — kevésbé generál hét felesleges file-t, kevesebb extraneous comment, nem talál ki új helper-funkciókat, ha már létezik a megfelelő. Ez a coding-agent enterprise-deployhatóságának a kulcs-tényezője. Egy reward-hackelő modell technical debt-generátor; egy “engedelmes” modell teamtárs.
“A Day with Claude” — a teamwork-narratíva. Az Anthropic a launch-hoz bemutató videót is készít: Maggie (PM) reggel asszisztálja Claude-dal a napját — Google Workspace, Asana-MCP-integráció, lit-review egy kutatási proposalra, Claude Code-dal egy “Cloud Cafe order management”-prototípus. A demo középpontja: “what feels like having Claude as a teammate.” Ez a positioning-szándék: nem chatbot, nem assistant, hanem teammate. Nate ebben a personal-assistant-fókusz kiépítését látja, szemben az OpenAI ChatGPT memory-fókusszal és a Google ambient-AI-fókuszával. Három különböző UX-tézis verseng — nem egyetlen winner-take-all.
Latent Space — DeepWiki és multi-turn RL
A hétnek két Latent Space-epizódja van.
DeepWiki — Silas Alberti (Cognition / Devon). A Cognition kiad egy ingyenes terméket: AI-generált wiki bármely GitHub-repóhoz, sign-up nélkül. Két komponens: a wiki maga (struktúrált doksi, architektúra-overview, core services-bontás), és egy deep-research agent, ami a kódbázison kérdez-felel. Numerek: induláskor 30 000 repo, 4 milliárd sor kód, $300 000 compute az indexelésre. Két héttel később tens of thousands repo, várhatóan átlépi a $1M compute-ot.
A leghasznosabb mérnöki insight: a kódbázis-megértéshez a folder-structure önmagában rossz signal. Alberti: “people sometimes just put all the components in this folder and all the servers in this folder, and imports go everywhere.” Ami működik:
- Language Server Protocol (LSP) graph — szimbólum-szintű függőségek
- Commit history graph — ki mit fejlesztett, ami ownership-jelzés
- Folder structure graph — gyenge, de baseline
A DeepWiki indexelője ezeket kombinálja, és high-level system extraction-t ad — “this is the alpha that DeepWiki has that I haven’t seen anywhere else”. SET-szempontból ez közvetlenül használható: ha enterprise-codebase-en agent-onboardingot tervezel, a folder-tree nem elég — LSP-kimenet és git-blame kötelező adatforrás. A DeepWiki-badge GitHub README-ben auto-refresh-t kapcsol, vagyis a wiki minden commit-tal frissül — ingyenes “always-up-to-date readme” lett az open-source világban.
Will Brown — multi-turn RL agentekhez. Brown most a Prime Intellectnél, korábban Morgan Stanleynél. Az epizód a Claude 4 launch utáni reakcióval kezdődik, és három mérnökileg releváns pont:
Egy: a turn-szintű RL-credit-assignment mint frontvonal. Klasszikus LLM RL: minden token egy action. Új mintázat: minden tool-call egy action, az állapot a tool-response. Ez sokkal természetesebb credit-assignment agentekre. Brown paper-je (Sila Gong-gal) ezt formalizálja a verifiers repo-ban — “models that are set up to use tools, often just won’t”, ezért az incentivizálás a reward-shaping-be kell kerüljön.
Kettő: a model-judge mint reward-source terjed. Determinisztikus szabályok (regex, parser) szétesnek a generalizálhatóságon — egy 2000 soros math-parser is csak ~98%-ot fog le. Cserébe LLM-as-judge (akár tool-using, akár reasoning) flexibilis és skálázható. Ez egybeesik az Anthropic konstitúciós AI trajektóriájával.
Három: a thinking-budget mint hyperparameter. “A hyperparameter is a target, not a hard cutoff.” Brown szerint a Quen-féle UI-ban már működik: a felhasználó token-budgetet állít, a modell megtanul abba beleilleszkedni. Az API-feature minden nagy lab-nál bejön — Claude 4-ben is. A SET-stack-szempont: a thinking-budget a tool-szerződés része, nem kliens-oldali optimalizálás.
Mellékszál — rovatok
- AI Super Week meta-jelenség. Nate hetet összefoglaló kerete — öt strategikus kérdés a vendor-akciókhoz. (1) Mi vált opcionálisból default-tá? (2) Milyen feedback-loop nyílt meg (a vendor most mit tud betanítani, amit eddig nem)? (3) Milyen bottleneck-attakot indítottak — coherent-e? (4) Milyen építhetőséget tett lehetővé — “two people in a coffee shop in San Francisco” könnyen építhetnek-e rá? (5) Milyen ár-vagy-kapacitás küszöb fordult át? Ez a vendor-evaluation-checklist, érdemes belső demo-review-knál is végigfutni.
- Ela Marina ($100M financing). A LMArena-csapat $100M-ot raise-elt. Brown szkeptikus: “to be an evals company, you kind of have to sell to the labs, but selling to the labs kind of wrecks evals.” Aki értékeli a frontier modelleket, az lehetőleg ne legyen pénzfüggő tőlük. Brown javaslata: a legjobb evals akadémikus eredet lesz — a kutatóhoz olcsó és van inkluzív incentive-e.
- Pride of ownership AI-világban. Nate május 19-i videójában egy nem-techikai, de tanulság-szintű tézist mond: az AI-eszközhasználatban a viták általában a tulajdonosi büszkeség három klasszikus kérdése alá esnek — (1) érted-e az anyagot? (2) tudod-e a chain of provenance-t? (3) felelsz-e a kimenetért? “You just cannot blame the machine.” A három kérdés a prompt-loggolás és AI-augmented-munka transzparenciája felé terel — “is your workspace artifacts in a position where a stranger fluent in the art could come in and gain similar high conviction?” Ezt enterprise audit-trail-policyként érdemes olvasni.
- Shopify “mastery system”. A Peter Yang-podcast május 25-i epizódja Sam Gregg-gel (Shopify VP Talent) kötelező AI-használat és mester-rendszer — minden Shopify-employee mastery-pontot gyűjt, IC és manager career-track egyenrangú. Két idézhető: “We see almost two-thirds of our engineers using cursor every single day” és “craftsmanship is the load-bearing property of every great product”. Az “AI-usage mandatory” egyre több cégnél default — érdemes követni, milyen formában jut el ide az európai/magyar enterprise.
Mit viszünk magunkkal
Három mérnöki / IT-vezetői kérdés, ami a hétből kiemelkedik:
- MCP mint OS-réteg, nem app-feature. A Microsoft döntése — MCP a Windowsba — kommodifikálja a tool-protocol-réteget. Ha most agent-stack-et tervezel, az MCP-szerverek listája kötelező eszköztári elem, mint régen az S3-bucket. SET-szempontból: a verifier-szerver, az audit-szerver, a customer-data-szerver mostantól MCP-szerződéssel publikálódik — ne saját REST-API-protokollt találj ki, ha az MCP-n elférsz. A standard-választás stratégiai.
- A “well-tested codebase” mint coding-agent-feltétel. A GitHub Copilot agent a “well-tested codebase”-en működik jól. Ez kimondja, hogy a test-coverage minőség nem fejlesztői kényelmi-faktor, hanem az agent-deployment előfeltétele. Ha vannak még repóid, ahol a coverage <40%, agent-onboarding nem ajánlott. Az ITLine-stack-felfogás itt 1-1-ben átfut: a SET (Software Engineer in Test) szerep most az AI-agent-előkészítés szerepévé válik — nem azért írunk teszteket, mert ezt szoktuk, hanem mert a teszt az agent input-szerződésének része.
- A “7-órás autonom-coding” mint kapacitástervezési input. Ha a Claude Opus 4 hosszabb futáshoz hivatott, a kérdés: milyen feladatok érnek meg 7 órát? Refaktor-batch, dependency-update + teszt-fix, security-scan-nel beazonosított vulnerability-fix, doksi-frissítés. Ezek korábban fejlesztői idő-allokáció voltak, mostantól éjszakai agent-batch. A capacity-planning ezzel együtt is fejlesztői felügyelet-órák számában mérhető — nem a sok agent, hanem a gondozott agent generál értéket.
A W22-ben várhatóan: a Claude 4 első valós-világi visszajelzések, OpenAI Operator-frissítés, és — folytatólagosan — a Project Mariner-agent-ek első GA-szivárgásai.
Források
Fő forrás — Nate B Jones csatornája:
- 2025-05-19 · Evolving Work in the Age of AI — “pride of ownership” három kérdése AI-világban; transzparencia és accountability.
- 2025-05-20 · This is AI Super Week, Here’s Why — heti narratíva-keret + öt strategikus vendor-kérdés.
- 2025-05-21 · May 20 — What Really Mattered at Google I/O — hét takeaway, $250-os tier, distribution-bottleneck-elemzés.
- 2025-05-23 · Claude 4 is Out — Comparison vs o3 and Gemini 2.5 Pro — early Opus-hozzáférés, native integration, 7-órás autonom-coding-szám.
Primer forrás — Anthropic hivatalos:
- 2025-05-22 · A Day with Claude — Maggie (PM) napi-rutin demo, Google Workspace + Asana MCP + Claude Code.
- Anthropic — Introducing Claude 4 — Opus 4 / Sonnet 4 launch (SWE-bench, Terminal-bench számok).
Körbejárás / tech-mélység — Latent Space podcast:
- 2025-05-21 · DeepWiki — The GitHub Encyclopedia (Silas Alberti, Cognition) — codebase-megértés LSP + commit-history graph + folder structure; auto-refresh wiki badge.
- 2025-05-23 · Multi-Turn RL for Multi-Hour Agents (Will Brown, Prime Intellect) — turn-szintű credit-assignment, model-as-judge, thinking-budget hyperparameter.
Bónusz / talent-perspektíva — Peter Yang:
- 2025-05-25 · How to Advance Your Career Without Managing People (Sam Gregg, Shopify) — mastery system, AI-usage mandatory, “craftsmanship as load-bearing property”.
Fact-check és hivatkozott eredeti források:
- Microsoft Build 2025 — open agentic web (hivatalos blog)
- GitHub — Coding Agent for GitHub Copilot (newsroom)
- 9to5Google — Google AI Pro and AI Ultra ($250)
- CNBC — Google launches $250 per month VIP AI subscription
- The Tech Portal — Google AI Ultra at I/O 2025
- Anthropic — Introducing Claude 4 (hivatalos blog)
A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.