Ezen a héten a coding-agent-kategória végleg átlép a “fejlesztő gépén futó CLI” formátumon: az OpenAI május 16-án bejelenti a Codex-et, egy cloud-first agentet, ami saját sandbox-konténerben fut, párhuzamosan tucatnyi taskon dolgozik, és a codex-1 modellel — az o3 SWE-re finomhangolt változatával — 72,1%-ot ér el a SWE-bench Verified-en egy próbálkozásra, 83,8%-ot nyolc próbálkozásra. A Codex-szel együtt megérkezik egy új repó-szintű konvenció: az AGENTS.md — szándékoltan nem readme.md, nem cursor-rules, nem branded-agent-config, hanem semleges szerződés, amit az ügynök elsőként olvas. Ugyanezen a héten a Windsurf — amit az OpenAI állítólag $3 milliárdért készül felvásárolni — kiadja a saját SWE-1 modellcsaládját, és Claire Vo (Chief Product Officer, LaunchDarkly) a Peter Yang podcastban élőben demózza, hogyan megy egy ChatPRD-ben írt PRD egyenesen Devon-nak, ami Slack-ből vezérelve PR-t ír. A háttérben pedig az IBM Institute for Business Value 2025-ös, 33 országban 2000 CEO-ra kiterjedő tanulmánya leszögezi: az AI-kezdeményezések 75%-a nem éri el a várt ROI-t — ez a hét másik oldala, amit Nate B Jones memetikus védelem kerete köré épít.
Codex — cloud-first, párhuzamos, és a fejlesztő nem nézi végig
A Codex-launch a Latent Space podcast “missing manual” epizódjában kapja meg az ipari kontextust. A vendégek Josh (compute platform, ex-Airplane founder) és Alexander (product). Három tervezési döntés érdekes egy enterprise-stack tervezésnél.
A form factor a termék. A Codex egy delegate-and-walk-away felület — a felhasználó nem nézi végig az iterációt; a feladat 1–30 percre (max 1 óra) elszáll, majd visszajön egy PR-rel, tesztriportokkal, citation-ökkel a logokba. Alexander szerint az “abundance mindset” központi: a sweet-spot user napi 60 párhuzamos taskot indít, mindegyikre 30 másodpercnél kevesebbet promptol. Ez UX-szempontból ellentéte a Cursor / Windsurf / Claude Code mintázatának, ahol a fejlesztő valós időben követi a generálást.
A “model is the product” tézis. Visszatérő vita: ha a modell rosszul használ egy tool-t, hardkódoljuk-e a megoldást a scaffolding-be, vagy tanítsuk meg a modellnek a következő training-runban? A Codex-csapat szándékosan az utóbbit választotta. A következmény: a fejlesztői dev-cycle hosszabb és drágabb (data-collection, RLHF, eval egy bug-fixre), de a határérték kitolódik — a state-machine összetettsége a modellben él, nem a fejlesztő agyában. Ez direkt ellentéte a W19-ben látott “smol agents are all you need” mintázatnak.
Az ‘agent’s first day on the job’ analógia. Alexander kerete: a base reasoning-modell egy “weirdly knowledgeable, spikily intelligent college grad”. A codex-1 ennek az első pár évnyi munkatapasztalatát kapja meg post-trainingben — például hogy mit tegyen egy PR-leírásba és mit ne. Minden új task pedig “első nap a cégnél” — itt jön az AGENTS.md, mint a céges onboarding-doksi.
AGENTS.md — semleges szerződés, és miért nem .cursorrules
Az AGENTS.md egy első ránézésre apró döntés, de a hivatalos Codex Developers-doksi és Alexander indoklása szerint sok replikálható elv van mögötte:
- Semleges, nem branded. Az OpenAI direkt nem
codex.md-t, nemchatgpt-agent.md-t választott. Az indok Alexander szerint: “we open-sourced the Codex CLI for a reason — safety problems for deploying these things shouldn’t have to be figured out more than once”. A logika ugyanaz, mint azDockerfilevagypackage.jsonneutralitásánál: ha minden agent-eszköz külön config-ot vár, a repó-tulajdonos kénytelen 5–6 közel azonos fájlt karbantartani. - Hierarchikus. A Codex egy gyökértől induló, alkönyvtárakban felülírható szabály-láncot olvas — nagyobb monorepóban így lokálisan finomítható egy rész-utasítás (pl.
frontend/AGENTS.mdmástól tér el, mintservices/payments/AGENTS.md). Ez a Cursor Rules és a.windsurfrulesfájloknál egy fokkal tervezettebb. - README-től elkülönül. Az indoklás: “there are things you want to tell an agent that you don’t need to tell a contributor, and vice versa”. Példa: a kódstílust az ügynök magától felismeri a kódbázisból, az embernek viszont konvenció-doksi kell. Fordítva: az embernek nem kell mondani, hogy fusson
pnpm install, az ügynöknek viszont a sandbox első feltöltésekor igen.
Az ipari elfogadás már zajlik: a GitHub-on az openai/codex repó saját AGENTS.md-jét nyitottan közli mint hivatkozási mintát. 2025 második felére az AGENTS.md valószínűleg ugyanúgy alap-elem lesz a repókban, mint a .editorconfig vagy a CONTRIBUTING.md.
Windsurf SWE-1 — a felvásárolt cég saját modellt ad ki
A Codex-launchhal párhuzamosan, május 15-én a Windsurf — a Cursor-rivális IDE — bejelenti a SWE-1 modellcsaládját: SWE-1, SWE-1-lite, SWE-1-mini. A pikantéria: az OpenAI ekkor már $3 milliárdos felvásárlási tárgyalásban van a Windsurffel — és a Windsurf saját, házon belül trénelt modellt ad ki, ami közvetlenül versenyez az OpenAI saját modelljeivel.
Nate B Jones a Codex-launchról szóló rövid videójában ezt a Frontier Lab-pozíciók eróziójaként keretezi: a kódgenerálás-tokenek piaca elég magas margójú ahhoz, hogy minden komoly AI-IDE saját modellt akarjon trénelni — a Cursor pedig hasonlóan kísérletezik. A következmény IT-vezetői szempontból: 2025-ben már nem érdemes egy adott agent-eszközt csak azért választani, mert egy adott Frontier-modellt használ — a stack alulról is kicserélődhet, és a választást a UX, az auditálhatóság és az integráció kell hogy hajtsa, nem a “hány paraméteres” mutató.
Claire Vo — a PRD mint prompt, és a Devon-as-Slack-colleague minta
A Peter Yang podcast Claire Vo-val képernyőn megosztott workflow-t mutat — élőben hibázik és élőben dolgozik, nem promo-demo. Claire CPO a LaunchDarkly-nél, és másfél emberrel futtatja a saját ChatPRD startupját.
A demonstrált workflow:
- Slack-ben prompt a ChatPRD-nek: “help me build a PRD… write me a PRD I can send to my engineering team”. A PM explicit megmondja, kinek lesz a következő olvasó — a modell ennek alapján hangolja a doc-stílust.
- A PRD markdown-ként exportálva, csatolva egy Devon-Slack-thread-be, az utasítással: “use the existing
SharedFeedbackModalcomponent”. - Devon ~14 lépéses tervet ír, opcionálisan approval-t kér, majd PR-t nyit.
- Claire kódot review-z, branchet pullol, lokálisan fut, mergeli. A repó-policy kötelezővé teszi: “we don’t deploy anything without review including AI stuff”.
Két átvihető megfigyelés. (a) A PM-fókusz áthelyeződik: a deep research → market understanding → strategy marad emberi, a doc-formátumozás és cross-team translation a modellé — “you can derive UI off docs, you can derive technical requirements off docs, if they’re written well enough”. (b) Claire kifejezetten Devon-t preferálja a Cursor felett, nem a kód-minőség, hanem a szinkron-vs-aszinkron interakció miatt — “I’m not at my computer all the time. I can at-mention Devon and say go fix this for me”. Ugyanaz a tézis, mint az OpenAI Codex form-factora: az igazi különbség nem a model-quality, hanem a delegáció-formátum.
Nate B Jones — két éles videó: memetikus védelem és a docs-mint-fő-artifact
Nate ezen a héten két olyan videót ad ki, amik közvetlenül a ‘productivity vs hype’ választóvonalon mozognak, és érdemes belső orientációs anyagként kezelni.
Memetikus védelem. A május 13-i videó öt elvet ad: (1) reality-check előadagolás, (2) bizonyíték-követelés (demo, nem slide; cost-proof; time-to-utility), (3) signal-to-buzz arány (model card, eval-szám), (4) másodlagos hatás-stress-test, (5) konstruktív szkepszis. Két data-point, ami a 2025-ös vezetői-narratíva fő ellenpontja: a W04-ben tárgyalt Klarna-ügy frissítése — a CEO most nyíltan elismeri, hogy az AI-csere “túl messzire ment”, és Klarna újra embereket vesz fel — és az IBM CEO-tanulmány: az AI-kezdeményezések 75%-a nem éri el a várt ROI-t, csak a 16% skálázódott enterprise-szinten.
A docs-mint-fő-artifact provokáció. A május 14-i videó felvetése: ha az LLM-ek hatékonyan fordítanak kontextusok között, akkor minek külön PRD, one-pager, test-case-leírás, press-release? Nate javaslata: a végfelhasználói dokumentáció (help docs, onboarding, API-ref) legyen a központi artifact, amiből a UI, a technikai követelmény, a business case mind levezethető. Provokatív, de direkten passzol Claire Vo workflow-jához, ahol a ChatPRD-doksi prompt-ként működik. Az ügyfél-facing docs-minőség most nem dokumentációs metric, hanem fejlesztési-velocity metric.
Mellékszál — rovatok
- AI-innováció-vita. A New York Times május 17-én publikál egy “Silicon Valley’s Elusive Fantasy” cikket, ami szerint az AI nem képes valódi innovációra. Nate május 18-i videóban válaszol konkrét tudományos eredményekkel: AlphaDev új sortírozási rutin (akár 70% gyorsabb, beépítve C++ tool-chainekbe), Halicin antibiotikum-felfedezés (MIT, AI-only molekulafeltérképezés), AlphaFold 200 millió fehérje-struktúra, DeepMind GNoME 2,2 millió kristály-vegyület prediktálva (380 ezer stabil, ebből 41 autonóm szintetizálva Lawrence Berkeley-nél), NASA Goddard evolúciós design-szoftverrel “alien-shaped” titán-tartók. A ténytartalom nem új, de a publikáció és a válasz együtt jól mutatja: a media-narratíva még mindig 18 hónappal le van maradva az ipari real-world impactről.
- Codex hard-limitek. A Latent Space epizód néhány konkrét számot is letesz: a Codex jelenleg 1 óra hard-cutoff (átlag jóval kevesebb, fejlesztői módban Alexander már látott 2 órás “off-the-rails” futást is); óránként 60 párhuzamos task limit indulásra fraud-detection miatt; internet-access lekapcsolva a futás során, prompt-injection-attack-okra nem mutatott érzékenységet a safety-tesztek alapján, de a csapat itt szándékosan konzervatív; SWEbench-eredmények egy része nem futtatható (state-management hibák), ezeket kiszűrik.
- Codex pricing még nyitott. A Latent Space-en kifejezetten kérdezik a pricinget — válasz: “too early to talk about pricing”. Ez közvetlen feszültségben van a Claude Code már bevezetett ár-modelljével, és a fejlesztők — joggal — aggódnak a heavy-use-cost-ról.
Mit viszünk magunkkal
A hét három mérnöki / vezetői tanulsága:
AGENTS.mdmint repó-szintű alap. Ha a csapatod 2-3 különböző coding-agent-eszközt használ (cursor, windsurf, claude code, codex), érdemes elkezdeni egy egységesAGENTS.md-t írni a fő repókba. A fájl kezdetben tartalmazza: a függőség-feltöltés-parancsokat, a tesztelési konvenciókat, a kódstílus-szabályokat, a tiltott területeket (pl. milyen fájlokat ne módosítson). Ez minden agent-tool-on átíveli a kontextust, és felkészíti a stack-et arra, hogy egy okosabb modell későbbre jobb teljesítményt adjon ugyanezzel a config-gal.- A ‘delegate-and-walk-away’ mintát értékelni — nem mindenre, de határozottan. Néhány típusú feladat a mostani Codex / Devon / cloud-form-factorral gyorsabb, mint egy IDE-ben kísért generálás: ismert kódstílusú, jól specifikálható feature-add-on, scoped bug-fix, refaktor egy modulban. Erre a stack-re már most érdemes egy belső “feladat-beváltás” prototípust építeni — Slack-bot vagy Linear/Jira-integráció. Pár-emberes csapatban (mint Claire Vo ChatPRD-jében) ennek a leverage-e bizonyítottan nagy.
- 75%-os ROI-miss mint tervezési kontextus. Az IBM-tanulmány és a Klarna-rehire együtt nem AI-szkepszisre ad okot — Nate maga is hangsúlyozza, hogy a 25% jól csinált projekt önmagában igazolhatja a befektetést. Inkább arra: a vezetői kommunikációban kerülni kell az “AI majd ezt megoldja” framing-et, és a verifier-réteg, az audit, a fail-back-emberi-eszkalálás alapba kell, hogy beleépüljön. Ez direkt szinkronban van a SET-tézissel: a verifikációs réteg nem mellék-projekt, hanem a stack központi eleme.
A W21-ben Anthropic Claude Sonnet 4 / Opus 4 várható (a W19-ben már szivárgó launch most jön), és Google I/O az AI-irányait közli.
Források
Fő forrás — Latent Space podcast:
- 2025-05-16 · ChatGPT Codex: The Missing Manual — Josh és Alexander (OpenAI Codex csapat) — form-factor, agents.md indoklása, model-as-product, 60-párhuzamos-task indító-mintázat, infra-konkrétumok.
Fő forrás — Peter Yang csatorna:
- 2025-05-18 · From Idea to Product in 30 Min Using AI Agents — Claire Vo — élő ChatPRD → Devon Slack-workflow, “product management is dead” keret, scrappiness / learning / communication / low-ego attribútumok.
Körbejárás — Nate B Jones:
- 2025-05-13 · AI Hype Requires Memetic Defense — öt elv a hype-szűréshez, Klarna-update, IBM-CEO-study idézet.
- 2025-05-14 · Rethinking Product and Engineering in the Age of AI — docs-mint-fő-artifact provokáció.
- 2025-05-16 · OpenAI Launches Codex — Codex defensive-launch keret, Windsurf SWE-1 mint Frontier-Lab-erózió.
- 2025-05-18 · Debunking AI Myths: Yes AI Can Be Truly Innovative — NYT-cikk-válasz, AlphaDev / Halicin / AlphaFold / GNoME / NASA-mounts.
Hivatalos és primer források / fact-check:
- OpenAI — Introducing Codex (2025-05-16) — codex-1 model, SWE-bench Verified 72,1% / 83,8%, cloud-sandbox spec.
- OpenAI Developers — AGENTS.md guide — hierarchikus szabály-lánc, README-vel való különbség.
- openai/codex GitHub — saját AGENTS.md mint példa
- InfoQ — Windsurf Launches SWE-1 Family (2025-05-15)
- WinBuzzer — Windsurf SWE-1 amid OpenAI’s $3B bid (2025-05-16)
- DevOps.com — OpenAI Acquires Windsurf for $3 Billion
- IBM — 2025 CEO Study (2025-05-06) — 2000 CEO, 33 ország, 75%-os ROI-miss, 16% enterprise-skálázott.
- Fortune — Klarna plans to hire humans again (2025-05-09) — CEO admits “we went too far”.
A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.