Heti AI-hírlevél · ITLine

2025-W20   2025-05-12 — 2025-05-18   ·   14 forrás

W20 — Codex a felhőbe lép, az AGENTS.md új szerződéssé válik, és a 75%-os ROI-miss az IBM-től

OpenAI Codex elindul: cloud-first agent, codex-1 modell (72,1% SWE-bench), AGENTS.md mint új repó-szintű szerződés. Windsurf SWE-1, Claire Vo PRD→Devon workflow, Nate B Jones memetikus védelme, és az IBM CEO-tanulmány: az AI-projektek 75%-a nem éri el a ROI-célt.

Kép helye — Bal oldalt egy laptop képernyő ChatGPT Codex felülettel, sok párhuzamos task-tal; jobb oldalt egy AGENTS.md fájl-ikon és köré csatlakozó cursor / windsurf / claude code / devon nyilak — ‘a repó-szintű ügynök-szerződés’

Ezen a héten a coding-agent-kategória végleg átlép a “fejlesztő gépén futó CLI” formátumon: az OpenAI május 16-án bejelenti a Codex-et, egy cloud-first agentet, ami saját sandbox-konténerben fut, párhuzamosan tucatnyi taskon dolgozik, és a codex-1 modellel — az o3 SWE-re finomhangolt változatával — 72,1%-ot ér el a SWE-bench Verified-en egy próbálkozásra, 83,8%-ot nyolc próbálkozásra. A Codex-szel együtt megérkezik egy új repó-szintű konvenció: az AGENTS.md — szándékoltan nem readme.md, nem cursor-rules, nem branded-agent-config, hanem semleges szerződés, amit az ügynök elsőként olvas. Ugyanezen a héten a Windsurf — amit az OpenAI állítólag $3 milliárdért készül felvásárolni — kiadja a saját SWE-1 modellcsaládját, és Claire Vo (Chief Product Officer, LaunchDarkly) a Peter Yang podcastban élőben demózza, hogyan megy egy ChatPRD-ben írt PRD egyenesen Devon-nak, ami Slack-ből vezérelve PR-t ír. A háttérben pedig az IBM Institute for Business Value 2025-ös, 33 országban 2000 CEO-ra kiterjedő tanulmánya leszögezi: az AI-kezdeményezések 75%-a nem éri el a várt ROI-t — ez a hét másik oldala, amit Nate B Jones memetikus védelem kerete köré épít.

Codex — cloud-first, párhuzamos, és a fejlesztő nem nézi végig

A Codex-launch a Latent Space podcast “missing manual” epizódjában kapja meg az ipari kontextust. A vendégek Josh (compute platform, ex-Airplane founder) és Alexander (product). Három tervezési döntés érdekes egy enterprise-stack tervezésnél.

A form factor a termék. A Codex egy delegate-and-walk-away felület — a felhasználó nem nézi végig az iterációt; a feladat 1–30 percre (max 1 óra) elszáll, majd visszajön egy PR-rel, tesztriportokkal, citation-ökkel a logokba. Alexander szerint az “abundance mindset” központi: a sweet-spot user napi 60 párhuzamos taskot indít, mindegyikre 30 másodpercnél kevesebbet promptol. Ez UX-szempontból ellentéte a Cursor / Windsurf / Claude Code mintázatának, ahol a fejlesztő valós időben követi a generálást.

A “model is the product” tézis. Visszatérő vita: ha a modell rosszul használ egy tool-t, hardkódoljuk-e a megoldást a scaffolding-be, vagy tanítsuk meg a modellnek a következő training-runban? A Codex-csapat szándékosan az utóbbit választotta. A következmény: a fejlesztői dev-cycle hosszabb és drágabb (data-collection, RLHF, eval egy bug-fixre), de a határérték kitolódik — a state-machine összetettsége a modellben él, nem a fejlesztő agyában. Ez direkt ellentéte a W19-ben látott “smol agents are all you need” mintázatnak.

Az ‘agent’s first day on the job’ analógia. Alexander kerete: a base reasoning-modell egy “weirdly knowledgeable, spikily intelligent college grad”. A codex-1 ennek az első pár évnyi munkatapasztalatát kapja meg post-trainingben — például hogy mit tegyen egy PR-leírásba és mit ne. Minden új task pedig “első nap a cégnél” — itt jön az AGENTS.md, mint a céges onboarding-doksi.

AGENTS.md — semleges szerződés, és miért nem .cursorrules

Az AGENTS.md egy első ránézésre apró döntés, de a hivatalos Codex Developers-doksi és Alexander indoklása szerint sok replikálható elv van mögötte:

  1. Semleges, nem branded. Az OpenAI direkt nem codex.md-t, nem chatgpt-agent.md-t választott. Az indok Alexander szerint: “we open-sourced the Codex CLI for a reason — safety problems for deploying these things shouldn’t have to be figured out more than once”. A logika ugyanaz, mint az Dockerfile vagy package.json neutralitásánál: ha minden agent-eszköz külön config-ot vár, a repó-tulajdonos kénytelen 5–6 közel azonos fájlt karbantartani.
  2. Hierarchikus. A Codex egy gyökértől induló, alkönyvtárakban felülírható szabály-láncot olvas — nagyobb monorepóban így lokálisan finomítható egy rész-utasítás (pl. frontend/AGENTS.md mástól tér el, mint services/payments/AGENTS.md). Ez a Cursor Rules és a .windsurfrules fájloknál egy fokkal tervezettebb.
  3. README-től elkülönül. Az indoklás: “there are things you want to tell an agent that you don’t need to tell a contributor, and vice versa”. Példa: a kódstílust az ügynök magától felismeri a kódbázisból, az embernek viszont konvenció-doksi kell. Fordítva: az embernek nem kell mondani, hogy fusson pnpm install, az ügynöknek viszont a sandbox első feltöltésekor igen.

Az ipari elfogadás már zajlik: a GitHub-on az openai/codex repó saját AGENTS.md-jét nyitottan közli mint hivatkozási mintát. 2025 második felére az AGENTS.md valószínűleg ugyanúgy alap-elem lesz a repókban, mint a .editorconfig vagy a CONTRIBUTING.md.

Windsurf SWE-1 — a felvásárolt cég saját modellt ad ki

A Codex-launchhal párhuzamosan, május 15-én a Windsurf — a Cursor-rivális IDE — bejelenti a SWE-1 modellcsaládját: SWE-1, SWE-1-lite, SWE-1-mini. A pikantéria: az OpenAI ekkor már $3 milliárdos felvásárlási tárgyalásban van a Windsurffel — és a Windsurf saját, házon belül trénelt modellt ad ki, ami közvetlenül versenyez az OpenAI saját modelljeivel.

Nate B Jones a Codex-launchról szóló rövid videójában ezt a Frontier Lab-pozíciók eróziójaként keretezi: a kódgenerálás-tokenek piaca elég magas margójú ahhoz, hogy minden komoly AI-IDE saját modellt akarjon trénelni — a Cursor pedig hasonlóan kísérletezik. A következmény IT-vezetői szempontból: 2025-ben már nem érdemes egy adott agent-eszközt csak azért választani, mert egy adott Frontier-modellt használ — a stack alulról is kicserélődhet, és a választást a UX, az auditálhatóság és az integráció kell hogy hajtsa, nem a “hány paraméteres” mutató.

Claire Vo — a PRD mint prompt, és a Devon-as-Slack-colleague minta

A Peter Yang podcast Claire Vo-val képernyőn megosztott workflow-t mutat — élőben hibázik és élőben dolgozik, nem promo-demo. Claire CPO a LaunchDarkly-nél, és másfél emberrel futtatja a saját ChatPRD startupját.

A demonstrált workflow:

  1. Slack-ben prompt a ChatPRD-nek: “help me build a PRD… write me a PRD I can send to my engineering team”. A PM explicit megmondja, kinek lesz a következő olvasó — a modell ennek alapján hangolja a doc-stílust.
  2. A PRD markdown-ként exportálva, csatolva egy Devon-Slack-thread-be, az utasítással: “use the existing SharedFeedbackModal component”.
  3. Devon ~14 lépéses tervet ír, opcionálisan approval-t kér, majd PR-t nyit.
  4. Claire kódot review-z, branchet pullol, lokálisan fut, mergeli. A repó-policy kötelezővé teszi: “we don’t deploy anything without review including AI stuff”.

Két átvihető megfigyelés. (a) A PM-fókusz áthelyeződik: a deep research → market understanding → strategy marad emberi, a doc-formátumozás és cross-team translation a modellé — “you can derive UI off docs, you can derive technical requirements off docs, if they’re written well enough”. (b) Claire kifejezetten Devon-t preferálja a Cursor felett, nem a kód-minőség, hanem a szinkron-vs-aszinkron interakció miatt — “I’m not at my computer all the time. I can at-mention Devon and say go fix this for me”. Ugyanaz a tézis, mint az OpenAI Codex form-factora: az igazi különbség nem a model-quality, hanem a delegáció-formátum.

Nate B Jones — két éles videó: memetikus védelem és a docs-mint-fő-artifact

Nate ezen a héten két olyan videót ad ki, amik közvetlenül a ‘productivity vs hype’ választóvonalon mozognak, és érdemes belső orientációs anyagként kezelni.

Memetikus védelem. A május 13-i videó öt elvet ad: (1) reality-check előadagolás, (2) bizonyíték-követelés (demo, nem slide; cost-proof; time-to-utility), (3) signal-to-buzz arány (model card, eval-szám), (4) másodlagos hatás-stress-test, (5) konstruktív szkepszis. Két data-point, ami a 2025-ös vezetői-narratíva fő ellenpontja: a W04-ben tárgyalt Klarna-ügy frissítése — a CEO most nyíltan elismeri, hogy az AI-csere “túl messzire ment”, és Klarna újra embereket vesz fel — és az IBM CEO-tanulmány: az AI-kezdeményezések 75%-a nem éri el a várt ROI-t, csak a 16% skálázódott enterprise-szinten.

A docs-mint-fő-artifact provokáció. A május 14-i videó felvetése: ha az LLM-ek hatékonyan fordítanak kontextusok között, akkor minek külön PRD, one-pager, test-case-leírás, press-release? Nate javaslata: a végfelhasználói dokumentáció (help docs, onboarding, API-ref) legyen a központi artifact, amiből a UI, a technikai követelmény, a business case mind levezethető. Provokatív, de direkten passzol Claire Vo workflow-jához, ahol a ChatPRD-doksi prompt-ként működik. Az ügyfél-facing docs-minőség most nem dokumentációs metric, hanem fejlesztési-velocity metric.

Mellékszál — rovatok

Mit viszünk magunkkal

A hét három mérnöki / vezetői tanulsága:

  1. AGENTS.md mint repó-szintű alap. Ha a csapatod 2-3 különböző coding-agent-eszközt használ (cursor, windsurf, claude code, codex), érdemes elkezdeni egy egységes AGENTS.md-t írni a fő repókba. A fájl kezdetben tartalmazza: a függőség-feltöltés-parancsokat, a tesztelési konvenciókat, a kódstílus-szabályokat, a tiltott területeket (pl. milyen fájlokat ne módosítson). Ez minden agent-tool-on átíveli a kontextust, és felkészíti a stack-et arra, hogy egy okosabb modell későbbre jobb teljesítményt adjon ugyanezzel a config-gal.
  2. A ‘delegate-and-walk-away’ mintát értékelni — nem mindenre, de határozottan. Néhány típusú feladat a mostani Codex / Devon / cloud-form-factorral gyorsabb, mint egy IDE-ben kísért generálás: ismert kódstílusú, jól specifikálható feature-add-on, scoped bug-fix, refaktor egy modulban. Erre a stack-re már most érdemes egy belső “feladat-beváltás” prototípust építeni — Slack-bot vagy Linear/Jira-integráció. Pár-emberes csapatban (mint Claire Vo ChatPRD-jében) ennek a leverage-e bizonyítottan nagy.
  3. 75%-os ROI-miss mint tervezési kontextus. Az IBM-tanulmány és a Klarna-rehire együtt nem AI-szkepszisre ad okot — Nate maga is hangsúlyozza, hogy a 25% jól csinált projekt önmagában igazolhatja a befektetést. Inkább arra: a vezetői kommunikációban kerülni kell az “AI majd ezt megoldja” framing-et, és a verifier-réteg, az audit, a fail-back-emberi-eszkalálás alapba kell, hogy beleépüljön. Ez direkt szinkronban van a SET-tézissel: a verifikációs réteg nem mellék-projekt, hanem a stack központi eleme.

A W21-ben Anthropic Claude Sonnet 4 / Opus 4 várható (a W19-ben már szivárgó launch most jön), és Google I/O az AI-irányait közli.

Források

Fő forrás — Latent Space podcast:

Fő forrás — Peter Yang csatorna:

Körbejárás — Nate B Jones:

Hivatalos és primer források / fact-check:


A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.