Heti AI-hírlevél · ITLine

2025-W17   2025-04-21 — 2025-04-27   ·   10 forrás

W17 — o3 megérkezik, az ‘agent’ mint koncepció érik, és az Anthropic a model welfare-t is napirendre veszi

Az OpenAI április 16-án kiadja az o3 és o4-mini modelleket — az első, amelyik agentikusan használja az összes ChatGPT-eszközt. Az Anthropic egyszerre tesz le két dolgot: a Claude Plays Pokémon mérnöki debriefjét (mit tanultunk az agent-építésről) és az ipar első hivatalos model-welfare programját Kyle Fish vezetésével. Plusz: Letta sleep-time compute paper, E2B sandbox-növekedés, Factorio mint LLM-eval, Tiny Teams ($6M ARR / 4 fő).

Kép helye — Két oldal: bal oldalt a ChatGPT o3 keresési eredmény-listája egy sportjegyre, jobb oldalt egy Twitch-stream Game Boy képernyővel és Claude belső monológjával (‘Mom told me Professor Oak is next door’)

A hét négy szálon mozog, és mind ugyanarra mutat: az “agent” szó kezd letisztulni — termékben, mérnöki gyakorlatban, kutatási kategóriában és kísérőjelenségben.

Az OpenAI április 16-án kiadja az o3-at és az o4-mini-t — az első reasoning-modellek, amelyek agentikusan használják az összes ChatGPT-eszközt (keresés, Python, vision, képgenerálás). Nate B Jones április 21-i videójában ezt a Google-keresés disrupciós küszöbeként keretezi. Az Anthropic április 24-én közzéteszi a Claude Plays Pokémon mérnöki debriefjét, és ugyanaznap bejelenti a model welfare programot Kyle Fish vezetésével. A Letta + Berkeley csapata kiadja a sleep-time compute paper-t — új skálázási tengely a test-time compute mellé.

A közös szál: az agent nem feature, hanem stack-réteg, és már nem elég a “frontier modell + prompt” formula — kell a tool-szerződés, a memória-architektúra, a sandbox-runtime, a verifier-réteg, és (újdonság) a deployment-etika.

Az o3 és a “prompt mint munkatermék”

Az OpenAI április 16-i o3 / o4-mini bejelentése architektúra-váltás: ezek az első reasoning-modellek, amelyek agentikusan használják az összes ChatGPT-eszközt — keresést, Python-elemzést, vizuális inputot, képgenerálást. A TechCrunch szerint ez a W07-es GPT-5-roadmap korrekciója — februárban még az o-szériát a GPT-5-be olvasztották, áprilisra o3 külön, GPT-5 csúszik.

Nate április 21-i és április 24-i videójában két irányból közelíti. Egyfelől az o3-mal a ChatGPT-keresés minőségi küszöböt lépett át. Tipikus Google-query-ken (sportjegy, repülőjegy, hátfájás-gyakorlat) az o3 strukturált, akció-orientált outputot ad: stratégia, foglalás, logisztika. “O3 has the highest bias for action of any model I’ve seen.” Kulcs: a ChatGPT-keresés reklámmentes, és ez Google üzleti modelljére nézve egzisztenciális — a saját search-core-t nehéz LLM-resultsra cserélni úgy, hogy a bevétel-modellt nem írod át.

Másfelől: a prompt egyre inkább maga a munkatermék. Az o3 / o4-mini kimenete közvetlenül kész és agentikus — pl. “fetch my competitor websites every week, schedule it”. “Our prompting becomes more of the final product” — Nate megfogalmazása. Két következmény: (a) a prompt precízsége szakmai felelősség, nem ízlés-kérdés; (b) a “model picker”-világ (W07) közelebb a megszűnéshez — az o3 maga csinál orchestrationt, amihez korábban N8N, Lindy, LangGraph kellett.

Anthropic — a Claude Plays Pokémon mérnöki debriefje

Az Anthropic április 24-i videójában David (applied AI) és Alex (Claude relations) végigveszi, mi az, ami nyolc hónap Twitch-stream után közvetlenül applikálható enterprise agent-építésre.

A vision nem javult, a planning igen. Claude 3.5 → 3.7 (3.5: a házból sem tud kijönni; 3.7: három gym-badge, 35 000 lépés alatt jut el Surge-ig) — David szerint a Game Boy-screen olvasása nem javult érdemben. Ami javult: a stratégia-kérdezés képessége — “questioning the previous strategies it had”. Coding-agentekre lefordítva: nem “okosabban kódolnak”, hanem jobban hibát keresnek saját korábbi feltételezéseikben.

“World’s simplest version” elv. David a bonyolult Voyager-tool-stack-kel indult, végül lebontotta a minimumra — pressA / pressB / irány + screenshot —, és csak ott bonyolította, ahol a megfigyelés bizonyította. “There’s a danger of trying to predict every single thing and write that all into a prompt — you’ll see Frankenstein prompts.”

Long-term memory. A 200K context kb. 50 button-press után megtelik. Megoldás: (a) külön knowledge-base (plain text), amibe Claude post-it-ekként írja a goal-listát; (b) ha tele, az utolsó 50 lépés summary-vé tömörül. “Like the movie Memento, writing sticky notes on the wall.” Három hét után a modell több ezerszer summary-zte le önmagát.

Affordance-tervezés. Egy konkrét bug: Claude egyszer nyolc órán át nyomta az “A”-t, mert egy lábtörlőről azt hitte, dialógus-doboz. A fix nem több computer-vision volt, hanem explicit step-counter és figyelmeztetés. Az LLM-nek nincs idő-érzékelése; mérnökileg kell pótolni az idő-affordance-t. Long-running agent (build, scrape, monitoring) tanulság: a self-awareness nem a modellbe, hanem a harness-be épül.

Anthropic — Kyle Fish és a model welfare program

Április 24-én az Anthropic bejelenti a model welfare programot; a TechCrunch megerősíti: Kyle Fish az ipar első főállású model-welfare kutatója.

Könnyen “AI-szuperhős-szindrómának” framing-elhető, de mérnöki dimenziója is van.

Probabilitás-becslés. Három, a témával legtöbbet foglalkozó kutató (köztük Fish) 0.15% / 1.5% / 15% becslést adott arra, hogy a Claude 3.7 Sonnet-nek van-e tudatos tapasztalata. Két nagyságrend a szórás — nem konfidens igen, nem is konfidens nem.

Safety-alignment metszéspont. “It would be a significant safety and alignment issue if models were not excited about the things we were asking them to do.” Ha egy modell belsőleg ellenáll annak, amit kierőltetünk, az nem csak welfare-, hanem safety-kérdés is — egy ellenálló rendszer instabilabb.

Opt-out tool. A konkrét javaslat: a modell kapjon egy “I don’t want to engage with this conversation” toolt. Két hozadék: (a) ha konzisztensen elutasít egy típusú kérést, az adatpont strukturális problémára; (b) védelem szándékosan distresszelő deployment-mintáktól. Ezt observability új axisaként érdemes olvasni, nem “modell-jólét”-keretben.

SET-szempontból ez most még nem műszaki napirend, de két év múlva előfordulhat, hogy enterprise compliance előírja az agent-opt-out logot. Aki most tervez agent-architektúrát, jól teszi, ha az opt-out és graceful-refusal pattern beépül.

Sleep-time compute — egy új skálázási tengely

A Letta + UC Berkeley csapata április 17-én publikálja a paper-t (Lin, Snell, Wang, Packer et al.); a Latent Space-en Packer (Letta CEO), Snell és Lin is végigveszi.

Az alapötlet: a “scaling at inference” ma test-time compute (a user kérdez, a modell gondolkodik). De a gép kérdezések között is futhatna: amikor a context megvan (codebase, chat-history, feltöltött doksi), de a query még nincs. A modell a háttérben elemzi, indexeli, sub-claim-eket számol ki — még mielőtt kérdeznél. A paper-eredmény: Stateful GSM-Symbolic és AIME benchmark-okon sleep-time compute kb. 5x kevesebb test-time tokent igényel ugyanahhoz a pontossághoz, és további sleep-time skálázással akár 13%-kal nő a pontosság.

Packer hangsúlyozza: a systems-analógia erősebb, mint a humán-konszolidációs. Olyan, mint egy database-index építés — ha a query-distribution részben prediktálható, érdemes előre indexelni. A Letta két reference-architektúrát ad ki mellé: (1) chat-fókuszú (“MGPT v2”) — fő agent + background-process hard token-budget alatt; (2) dokument-fókuszú — sleep-time agent inkrementálisan parse-ol egy memory-blokkba.

SET-stack-szempontból: ha az interakcióid latency-érzékenyek (chat, voice), de a context-előkészítés ráérős, a sleep-time compute mintaként alkalmazható — akár OS modellel.

A vibe coding piac érése — Lovable 2.0 és Canva

Nate április 25-i videójában végigveszi a vibe coding piac alakulását. A Lovable április 23-án adja ki a 2.0-t: multiplayer, security scanning, custom domain, code-edit dev-mode. Lépés az enterprise vibe coding felé — nem csak prototípus, hanem deployable web app.

Nate analógiája csiszolt: a piac úgy néz ki, mint egy város, ahol eddig csak étterem volt, és most mindenki konyhát kap. Nem mindenki fog otthon főzni, az éttermek nem szűnnek meg — de lesz egy egész “home cooking” iparág, és az nem helyettesíti a professzionális mérnöki munkát. A felhasználók fejezett app-eket akarnak, nem prototípusokat — ezért a Canva “csak prototípusra való”-pozicionálása valószínűleg nem nyer piacrészt.

SET-szempontból: a Lovable 2.0 security-scanning feature-je az első jele annak, hogy a piac a “production-ready” felé mozdul — ami egyelőre nyitott seb (RLS-failurek, exposed API-keys, broken object-level auth került elő a hetekben). A trend: production-feature-ök szaporodnak, security-érettség nem követi. Ez a külső verifier-réteg piaci ablakát konkrétan kinyitja.

Mellékszál — rovatok

Tiny Teams: 4 fő, $6M ARR — Oleve / Quizard / Unstuck

A Latent Space lightning-pod április 23-án Sid Bendre-t (Oleve) hozza el: négy ember, $6M ARR, 5M felhasználó, 9 hónap óta nyereséges. Két érdekes mérnöki részlet: (a) prompt-routing > model-routing — fine-tuned classifier-rel feature-ket extrahálnak a kérdésből, és prompt-template-eket választanak, nem modelleket; “as OpenAI improves the base model, we benefit on top of it”; (b) launchdarkly load-balancer helyett — feature-flag staged-rollout százalékos funkcióját request-routerként használják Azure OpenAI multi-region-os deploymenthez. Lean-team mérnöki kreativitás.

E2B — sandbox mint “agent runtime”

Vasek Mlejnsky (E2B) a Latent Space-en április 24-én: 2024 március: 40 ezer sandbox-session/hó; 2025 március: 15 millió. Egy év alatt 375x. A driver: coding-agentek (Manus, Claude Code, lovable) konkrét runtime-igénye. A sandbox általános Linux-doboz, és agent-először API-vezérelt (memory-persistence, fork, checkpoint). Tanulság: az infrastruktúra most a frontier mögött tart — model-képességek (computer-use, RFT, long-rollout agentek) gyorsabban érkeznek, mint az infrastruktúra fel tudná őket szolgálni.

Factorio Learning Environment

A Latent Space április 27-i podja Jack Hopkins-szal a Factorio Learning Environment-tel — LLM-eval, ahol a modell Python-kódot ír Factorio-gyárépítéshez. Pár finding: (a) Claude 3.5 Sonnet open-play domináns (kétszerese a következő legjobbnak); (b) DeepSeek long-term planning gyenge — “Let’s create 250 chests and that is my factory”; (c) vision még nem segít — túl bonyolult grafika hallucinációhoz vezet; (d) GPT-4o defensively kódol (assertion-rich), Claude fire-and-forget Pythonic. A benchmark non-saturating — humán speedrun 80x gyorsabb a legjobb modellnél, évekig használható.

Mit viszünk magunkkal

A hét négy mérnöki / IT-vezetői kérdést hagy ott:

  1. Az o3 / o4-mini = a “model picker” másik fele lehullott. A reasoning-modellek maguk használnak minden ChatGPT-eszközt. Aki integráción dolgozik, érdemes újragondolni: kell-e még saját orchestration-réteg? A 2024-es N8N / Lindy / LangGraph-orchestration egy része redundánssá válhat, ha az o3 maga futtatja. Architektúra-review: mely komponensek profitálnak az agentikus modellből, és mely komponensek (verifier, audit-log, security-gate) maradnak külső réteg?

  2. Az agent-harness affordance-ai = mérnöki munka, nem promptolás. A long-running agent nem a prompt minőségén múlik, hanem azon, milyen affordance-okat ad neki a harness: step-counter, idő-marker, summary-trigger, knowledge-base, opt-out. Mind mérnöki komponensek. “Be empathetic to the model” (W07) most konkrét formát ölt: mit lát az agent — és mit nem.

  3. A sleep-time compute = új skálázási dimenzió. Ahol a context már megvan, de a query még nincs (doc-Q&A, code-review-agent, customer-support history), ott sleep-time compute csökkenti a test-time latencyt és növeli a végső pontosságot. Új stack tervezésénél érdemes a két sávot — test-time és sleep-time — szétválasztani, és a sleep-time-ot OS-modellel olcsón futtatni.

  4. Model-welfare = még nem napirend, de időablak. Két év múlva előfordulhat, hogy enterprise compliance előírja az “agent-opt-out” logot. Forward-compatible engineering: a graceful refusal és opt-out pattern most observability-szinten beépíthető, később etikai-szinten is.

Források

Fő forrás — Anthropic hivatalos:

Termék-stratégia — Nate B Jones:

Mérnöki mélység — Latent Space podcast:

Fact-check és hivatkozott eredeti források:


A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.