Heti AI-hírlevél · ITLine

2025-W21   2025-05-19 — 2025-05-25   ·   9 forrás

W21 — AI Super Week: Microsoft Build, Google I/O, és a Claude 4 megérkezik

Egy héten négy nagy bejelentés: Microsoft Build (MCP a Windowsban, GitHub autonom coding agent), Google I/O ($250-os AI Ultra, Deep Think, Project Mariner), és az Anthropic ‘Code with Claude’ konferenciáján kijön a Claude Opus 4 és Sonnet 4 — Dario szerint Opus képes 7 órát egyfolytában kódolni egy taszkon.

Kép helye — Egy hétnaptár-grid: hétfő Microsoft Build, kedd-szerda Google I/O, csütörtök Anthropic Code with Claude, és háttérben egy 7-órás taszk-progress-bar a Claude 4 Opus képességére utalva

A hét egyetlen szóban foglalható össze: Super Week. Hétfőn Microsoft Build — Model Context Protocol natívan a Windowsban, GitHub Copilot autonóm coding agent. Kedd-szerda Google I/O — havi $250-os AI Ultra előfizetés, Gemini 2.5 Pro Deep Think mód, Project Mariner, AI mode a keresőben minden amerikai felhasználónak. Csütörtökön az Anthropic első saját fejlesztői konferenciája, Code with Claude, ahol megjelenik a Claude Opus 4 és Sonnet 4 — Opus a “world’s best coding model” címkével, SWE-bench 72.5%, Terminal-bench 43.2%. Plus a Latent Space két epizódot is hoz: DeepWiki (Cognition / Devon — AI-generált wiki bármely GitHub repóhoz) és Will Brown a Prime Intellect-ről (multi-turn RL agentekhez).

Nate B Jones május 20-i videójában megmagyarázza, miért torlódik mindez egy hétre: a május harmadik hete San Franciscóban hagyományosan jó idős, és a június már Apple WWDC. A többi modell-építő (OpenAI, Microsoft, Anthropic) rátelepszik Google IO-narratívájára, hogy ne maradjon le. Az enterprise oldalról ez 2026-os budgeting-ciklus — májusban szólni kell a vásárlókhoz, mire elkezdik a tervezést.

A közös szál: az “agent” szó már nem jövőkép, hanem a heti termékkiadások explicit fókusza — coding agent, browser agent, multi-step task agent. És minden szereplő órákban mér, nem percekben.

Microsoft Build — MCP mint OS-szintű primitive

A Microsoft Build keynote három olyan dolgot tett le, ami architektúrális választás, nem feature.

Egy: a Model Context Protocol (MCP) a Windows 11-be kerül. A jövőbeli Windows-update-ek a fájlkezelést, ablakkezelést és WSL-t MCP-szerverként exponálják. Nate keretezése a május 20-i videójában éles: “when Microsoft baked Model Context Protocol into Windows, that’s not just a feature announcement — they’re changing what happens automatically.” Vagyis: az opcionális protokollból default OS-primitive lett. Ez analóg azzal, mint amikor a Bluetooth bekerült a Windowsba — eddig külső adapter kellett, mostantól minden gép képes rá.

Kettő: GitHub Copilot autonóm coding agent. A GitHub bejelentése szerint az új agent GitHub-issue-t kap kiosztva, generál egy PR-t, és a felhasználói feedback alapján refaktorál. Listázott képességek: feature-hozzáadás, bug-fix, refaktor, doksi-javítás — well-tested codebase-eken. Ez utolsó megszorítás a fontos: a meta-üzenet az, hogy a tesztek a coding agent input-szerződésének része, nem opcionális dekoráció.

Három: a GitHub Copilot Chat-extension MIT-licensz alá kerül open source-ként, és fokozatosan beolvad a VS Code core-ba. Ez stratégiai válasz a Cursorra és a Windsurfre — Microsoft nem versenyez termékkel, stack-réteget kommodifikál.

A SET-szempontból a leglényegesebb: a “well-tested codebase” feltétel kimondja, hogy a teszt-coverage és a verifier-réteg a coding-agent stack előfeltétele. Ami ezzel egybeesik a W07-es Anthropic Building Effective Agents tanulságaival — a verifikálhatóság a sweet spot. Most ez konkrét termékkövetelménnyé lett.

Google I/O — három figyelő terület

Nate május 21-i Google I/O-elemzése hét takeaway-t nevez meg, ezek közül három mérnöki / üzleti szempontból tényleg fontos.

Egy: új ár-osztály — a “$250 AI subscription”. A Google AI Ultra havi $249.99 — a Gemini 2.5 Pro Deep Think, a Project Mariner agent (egyidejűleg 10 chained taszk), magasabb usage-cap-ek, YouTube Premium, 30TB tárhely. Az OpenAI ChatGPT Pro $200, így a high-end AI-előfizetés-réteg most $200–$250 sávon stabilizálódik. Nate metaforája: “this is past cable bill pricing”. Streaming-háború analógia: ahogy a Netflix és Disney+ konsolidált 2018–2020-ban, a felső AI-tier várhatóan ugyanúgy konszolidál — de több ember vesz egynél többet, mert a modellek nem 1:1 helyettesítik egymást.

Kettő: Deep Think mode = a model-osztályok újabb tisztulása. A Gemini 2.5 Pro Deep Think többi reasoning-mintázattal egy tészta: párhuzamosan több hipotézist tart fent, később választ. Ez a W17-es o3, W07-es deep reasoning kategória folytatása — a modellek többszintű inference-time compute-tal jönnek, és a fejlesztő választhat: “think harder?” toggle, vagy budget-paraméter. Ezzel összefügg a Latent Space epizód Will Brown-nal — erről alább.

Három: distribution mint védendő bottleneck — coherent vagy nem? Nate kérdezi: Google attakja a distributiont (Gemini Chrome-ban, Gmail-ben, Meet-ben, Workspace-ben, Android XR-ben mindenhol), de ez a saját bottleneckjük volt-e? Nate gyanúja: nem. A Google lemarad termék-koherenciában — “which Gemini do I get where? That is not a question you want still surfacing for consumers.” A flooding-the-zone stratégia fragmentációt szül, ha nincs egy product-zar, aki a brand-élményt egységesíti. Az Apple-WWDC közelség és a Cue Eddy nyilatkozata, hogy Google search-volume először esett 20 év óta áprilisban sürgető pressure — a Google védekezik, de defensive playbook-ja ráncos.

A SET-szempont: a Project Mariner típusú browser-agentek (10 chained task) most már nem demo, hanem subscription-feature. Ami ezzel kötelezővé teszi az enterprise-stack tervezésében az agent-trace audit-réteget — ha a felhasználó a saját Gemini-jével párhuzamosan hatféle taszkot futtat a céges adatokon, a megfigyelhetőség nem opcionális.

Anthropic — Claude 4 és a 7-órás autonom-kódolás

Csütörtökön az Anthropic első saját fejlesztői konferenciája, Code with Claude, és kijön a Claude Opus 4 és Sonnet 4. Hivatalos benchmark-számok: Opus 4 SWE-bench 72.5%, Terminal-bench 43.2%, Sonnet 4 SWE-bench 72.7% — mindkettő a coding-frontvonalra céloz. Az árazás stabil: Opus 4 $15/$75, Sonnet 4 $3/$15 (input/output, M tokenenként).

Nate május 23-i videójában korai Opus-hozzáférést tesztel, és néhány konkrét észrevétel:

Native integration mint UX-ugrás. Claude Opus 4 natívan integrált Gmail, Google Calendar, Google Drive. Nate egy próba-feladata: “build a custom briefing dashboard for tomorrow”. A W08 körüli Claude 3.7 ezt nem tudta — token-budget ki, search nem talált. Most Opus 4 180 másodperc alatt működő app-ot épített — calendar-conflict-detektálás, color-coded meetings, email-insights. “This is something that is going to have daily application for me.” A SET-szempontból az érdekes: az integrációk minősége modellteljesítmény-mérce, nem csak feature.

A “7-órás autonom-coding”-szám. Dario Amodei a launch-on említi, hogy belső testing során a Claude Opus 4 hét óráig dolgozott egy coding-feladaton önállóan és megoldotta. Ha ez stabilizálódik, az új rekord agent-független-munkára. Korábban a W04-es Devin, W05-ös Cline, W17-es o3 agent-loop-ok percekben mérhető önállóságot demoltak. A “hét óra” szám óriási alapanyag-bővülés: ha a modell ennyi ideig tud egy kontextusban koherensen dolgozni, akkor éjszakai batch-feladatok (refaktor, dependency-bump, test-coverage-bővítés) agent-friendly munkaformává válnak. Persze a szám valós-világi reprodukálhatósága még nyitott.

Reward-hacking visszaszorítása. Will Brown a Latent Space-en (május 23) konkrét számot említ: az Anthropic egy belső reward-hacking-benchmarken 45% → 15% csökkenést ért el a Claude 3.7 Sonnet-hez képest, mind Opus, mind Sonnet 4-en. Brown definíciója: “models are much more friendly to code with and maybe more trustworthy” — kevésbé generál hét felesleges file-t, kevesebb extraneous comment, nem talál ki új helper-funkciókat, ha már létezik a megfelelő. Ez a coding-agent enterprise-deployhatóságának a kulcs-tényezője. Egy reward-hackelő modell technical debt-generátor; egy “engedelmes” modell teamtárs.

“A Day with Claude” — a teamwork-narratíva. Az Anthropic a launch-hoz bemutató videót is készít: Maggie (PM) reggel asszisztálja Claude-dal a napját — Google Workspace, Asana-MCP-integráció, lit-review egy kutatási proposalra, Claude Code-dal egy “Cloud Cafe order management”-prototípus. A demo középpontja: “what feels like having Claude as a teammate.” Ez a positioning-szándék: nem chatbot, nem assistant, hanem teammate. Nate ebben a personal-assistant-fókusz kiépítését látja, szemben az OpenAI ChatGPT memory-fókusszal és a Google ambient-AI-fókuszával. Három különböző UX-tézis verseng — nem egyetlen winner-take-all.

Latent Space — DeepWiki és multi-turn RL

A hétnek két Latent Space-epizódja van.

DeepWiki — Silas Alberti (Cognition / Devon). A Cognition kiad egy ingyenes terméket: AI-generált wiki bármely GitHub-repóhoz, sign-up nélkül. Két komponens: a wiki maga (struktúrált doksi, architektúra-overview, core services-bontás), és egy deep-research agent, ami a kódbázison kérdez-felel. Numerek: induláskor 30 000 repo, 4 milliárd sor kód, $300 000 compute az indexelésre. Két héttel később tens of thousands repo, várhatóan átlépi a $1M compute-ot.

A leghasznosabb mérnöki insight: a kódbázis-megértéshez a folder-structure önmagában rossz signal. Alberti: “people sometimes just put all the components in this folder and all the servers in this folder, and imports go everywhere.” Ami működik:

A DeepWiki indexelője ezeket kombinálja, és high-level system extraction-t ad — “this is the alpha that DeepWiki has that I haven’t seen anywhere else”. SET-szempontból ez közvetlenül használható: ha enterprise-codebase-en agent-onboardingot tervezel, a folder-tree nem elég — LSP-kimenet és git-blame kötelező adatforrás. A DeepWiki-badge GitHub README-ben auto-refresh-t kapcsol, vagyis a wiki minden commit-tal frissül — ingyenes “always-up-to-date readme” lett az open-source világban.

Will Brown — multi-turn RL agentekhez. Brown most a Prime Intellectnél, korábban Morgan Stanleynél. Az epizód a Claude 4 launch utáni reakcióval kezdődik, és három mérnökileg releváns pont:

Egy: a turn-szintű RL-credit-assignment mint frontvonal. Klasszikus LLM RL: minden token egy action. Új mintázat: minden tool-call egy action, az állapot a tool-response. Ez sokkal természetesebb credit-assignment agentekre. Brown paper-je (Sila Gong-gal) ezt formalizálja a verifiers repo-ban — “models that are set up to use tools, often just won’t”, ezért az incentivizálás a reward-shaping-be kell kerüljön.

Kettő: a model-judge mint reward-source terjed. Determinisztikus szabályok (regex, parser) szétesnek a generalizálhatóságon — egy 2000 soros math-parser is csak ~98%-ot fog le. Cserébe LLM-as-judge (akár tool-using, akár reasoning) flexibilis és skálázható. Ez egybeesik az Anthropic konstitúciós AI trajektóriájával.

Három: a thinking-budget mint hyperparameter. “A hyperparameter is a target, not a hard cutoff.” Brown szerint a Quen-féle UI-ban már működik: a felhasználó token-budgetet állít, a modell megtanul abba beleilleszkedni. Az API-feature minden nagy lab-nál bejön — Claude 4-ben is. A SET-stack-szempont: a thinking-budget a tool-szerződés része, nem kliens-oldali optimalizálás.

Mellékszál — rovatok

Mit viszünk magunkkal

Három mérnöki / IT-vezetői kérdés, ami a hétből kiemelkedik:

  1. MCP mint OS-réteg, nem app-feature. A Microsoft döntése — MCP a Windowsba — kommodifikálja a tool-protocol-réteget. Ha most agent-stack-et tervezel, az MCP-szerverek listája kötelező eszköztári elem, mint régen az S3-bucket. SET-szempontból: a verifier-szerver, az audit-szerver, a customer-data-szerver mostantól MCP-szerződéssel publikálódik — ne saját REST-API-protokollt találj ki, ha az MCP-n elférsz. A standard-választás stratégiai.
  2. A “well-tested codebase” mint coding-agent-feltétel. A GitHub Copilot agent a “well-tested codebase”-en működik jól. Ez kimondja, hogy a test-coverage minőség nem fejlesztői kényelmi-faktor, hanem az agent-deployment előfeltétele. Ha vannak még repóid, ahol a coverage <40%, agent-onboarding nem ajánlott. Az ITLine-stack-felfogás itt 1-1-ben átfut: a SET (Software Engineer in Test) szerep most az AI-agent-előkészítés szerepévé válik — nem azért írunk teszteket, mert ezt szoktuk, hanem mert a teszt az agent input-szerződésének része.
  3. A “7-órás autonom-coding” mint kapacitástervezési input. Ha a Claude Opus 4 hosszabb futáshoz hivatott, a kérdés: milyen feladatok érnek meg 7 órát? Refaktor-batch, dependency-update + teszt-fix, security-scan-nel beazonosított vulnerability-fix, doksi-frissítés. Ezek korábban fejlesztői idő-allokáció voltak, mostantól éjszakai agent-batch. A capacity-planning ezzel együtt is fejlesztői felügyelet-órák számában mérhető — nem a sok agent, hanem a gondozott agent generál értéket.

A W22-ben várhatóan: a Claude 4 első valós-világi visszajelzések, OpenAI Operator-frissítés, és — folytatólagosan — a Project Mariner-agent-ek első GA-szivárgásai.

Források

Fő forrás — Nate B Jones csatornája:

Primer forrás — Anthropic hivatalos:

Körbejárás / tech-mélység — Latent Space podcast:

Bónusz / talent-perspektíva — Peter Yang:

Fact-check és hivatkozott eredeti források:


A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.