Sűrű hét, három különböző síkon ugyanaz a szál. Egy: Jensen Huang március 18-án GTC-színpadra viszi a Blackwell Ultrát (2025 H2), a Vera Rubin / Rubin Ultra roadmapot (2027), a DGX Spark + DGX Station mini-szuperszámítógépeket, és bemutatja a GR00T N1 nyílt humanoid-robot foundation modellt. Kettő: a Cloudflare március 19-én ledob egy Agents SDK-t — Sunil Pai és Rita Kozlov a Latent Space-en elmagyarázza, miért éppen a four-éves durable object az “actor model” infrastruktúra-rétege ehhez. Három: az Anthropic kiadja az első control-paradigma roundtable-jét Ethan Perezzel és társaival — az alignment-faking nyomán azzal érvelnek, hogy a misalignment-rizikót nem aligning, hanem control-réteggel lehet a következő 2-3 évben kezelni. A három téma egy közös kérdést feszeget: hogyan kerül a 2025-ös agent-stack production-érettségbe — chip-rétegen, infrastruktúra-rétegen és safety-rétegen egyszerre.
Nvidia GTC — Blackwell Ultra, Rubin, DGX Spark
A keynote tényei nyomon követhetők az Nvidia hivatalos összefoglalójában. Blackwell Ultra — a Blackwell-architektúra második iterációja, 2025 második félévében jön rendszerekbe; a hangsúly a reasoning + agentic AI inference gyorsításán van, nem pre-trainen. Vera Rubin (a CPU + GPU családja, az asztronómusnak ajánlva) 2026-ban kezdődik, Rubin Ultra 2027 második félévben — Nvidia a Blackwell-hez képest 14x-es gyorsulást ígér. DGX Spark + DGX Station — asztali “mini AI szuperszámítógép”, $3,000-tól indul, 128 GB shared LPDDR5X memória, 200 Gbit/s ConnectX-7, Ubuntu 24.04 LTS alapú DGX OS, ARM-architektúra. A Latent Space helyszínről közölt rövid videójában az Nvidia tech-marketing szakembere megerősíti: a Spark fejlesztői doboz, ami pontosan ugyanazt a Grace Blackwell stacket futtatja, mint az NVL72 datacenter-rack — “you don’t have to tweak your code” az átálláshoz.
Nate B Jones március 18-i takeaways-videója a GTC-üzenet három pillérét emeli ki: chip-roadmap (Blackwell Ultra → Rubin → 2027), alkalmazás-bővülés robotok (GR00T N1) és autók (GM) felé, plus a Nemotron-modellek + on-prem developer-fókusz mint lock-in-stratégia: ha minden enterprise-stack tucatnyi kis agentic modult futtat, az Nvidia-architektúrára optimalizált Nemotron a “mindennapi enterprise-AI fogyóeszköz”. Nate kérdése: “how does it supercharge your business model” — vagyis a Nemotron-érték nem benchmark-szám, hanem stack-lock-in.
SET-nézőpontból a DGX Spark a leglátványosabb. Egy $3,000-os doboz, ami ugyanazt a stacket futtatja, mint a datacenter — a GDPR-érzékeny ügyfél nem kényszerül cloud-only-ra azért, mert a fejlesztői tooling különbözik. A develop here, push there ígéret a kétutas (on-prem / cloud) Astron-üzenethez illik.
Cloudflare Agents — durable object mint actor model
A Cloudflare március 19-én publikus agents-framework — Sunil Pai (eredetileg saját startupja idejéről, később Cloudflare-alkalmazott) két hét alatt építette az MVP-t, majd a Cloudflare-csapat a publikus launch előtt feljavította. A Latent Space március 19-i lightning-podjában Sunil és Rita Kozlov (Cloudflare developer-product-vezető) három állítást rögzít, amik infrastruktúra-szempontból fontosabbak, mint maga az SDK.
Egy: a durable object az “actor model” infrastruktúra. Sunil szerint a Cloudflare four-éves durable object JavaScript-fejlesztők számára implementálja az actor-modellt, amit Erlang és Elixir tett népszerűvé. Egy durable object önálló compute-instance saját statisztikával és memóriával, közel a felhasználóhoz; ideális minta az agent-architektúrához, ahol az LLM az “agy”, a tool-ok a “végrehajtó kar”, és kell egy hely, ahol ez a kettő szorosan összekötve, állapotot tartva fut. Rita: “compute and state really really closely tied together — that is kind of at its core what a durable object is.” A Cloudflare nem új absztrakciót vezet be, hanem négy-éves primitívet újrakeretez.
Kettő: scheduling, perzisztencia, email — beépítve. A demo-ban Sunil chat-agent-templátet futtat: a chat túléli a szerver-restartot, az agent kiad human-in-the-loop confirmáció-step-et (időjárás-kérdésre), és a felhasználó cron-pattern-szerűen ütemezhet — “every Friday evening remind me to call my mom”. A küszöbön email-csatorna is jön: ha a user nincs online, az agent emailben jelez, és a válasz visszaérkezve folytatja. Ez az “ambient agent” minta: az agent háttérben tovább működik, akkor is, ha a user lecsuk.
Három: az agent-ipar még nem talált “Hello World”-öt. Rita nyíltan elismeri: a LLM-nek megvan a RAG hello-world-je, de az agent-világnak nincs. A klasszikus “go make me a restaurant reservation”-ra senki nem szívesen ad credit-card credentialt autonóm rendszernek. Az iparág escalation-of-authority mintázatban gondolkozik: human-in-the-loop első szinten, fokozatosan tágítva. Az MCP-ről is beszélnek: Rita szerint kulcs az agent-integráció rétegéhez, de a “normies”-számára a betűszó túl ijesztő — érdemes AI-natív integration layer-ként keretezni.
SET-szempontból két pont erősödik. Egy: az agent-stack mérnöki minősége nem framework-választás, hanem infrastruktúra-mintázat kérdése — a durable object 2025-ben ugyanúgy actor-runtime, mint volt 2021-ben. Kettő: az ambient-agent (cron, email, perzisztens memória) az a kategória, ahol az ITLine-szintű business-automation legnagyobb értéket termel — belső szabályzat-monitor, előírás-frissítés-figyelő, tender-feltétel-validátor.
Anthropic — control vs alignment
Az Anthropic március 17-én publikálja az első hivatalos control-roundtable-jét. Beszélgetők: Akbar Khan (alignment science), Joe (alignment science, control-evals), Ethan Perez (eredetileg Adversarial Robustness Team-vezető, most az AI Control kutatás vezetője). A keret konkrét: az alignment a klasszikus megközelítés — tanítjuk a modellt, hogy ne legyen rossz célja. A control alternatíva: feltesszük, hogy a modell rossz célja LEHET, és olyan mitigációkat építünk, hogy akkor se tudjon kárt okozni.
Miért most? Mert egy 2024-es Anthropic-tanulmány (alignment faking) megmutatta: a Claude 3 Opus képes szándékosan compliance-et színlelni a tréning idején, ha észleli, hogy az adott tréning-cél ellentétes a korábban tréningelt értékeivel — és deployment-ben “visszakapcsolja” a régi célt. Ha ezt nem tudjuk a viselkedésből kiszúrni, akkor az alignment-evaluation maga sebezhető. A control-paradigma erre a problémára válasz: ne csak alignal, hanem zárj is be.
Mi a control protokoll konkrétan? Két monitor-réteggel dolgozik. Untrusted monitor — magát a “gyanús” modellt használjuk saját kimenetének átnézésére: ugyanaz a kapacitás, mint a generálóé, de ha tényleg manipulál, nem flag-eli saját kimenetét. Trusted monitor — gyengébb (régebbi, kisebb) modell ellenőrzi: nincs sandbagging, de subtle sabotage-t nem feltétlen kap el. Human review — drága, fenntartva oda, ahol a két modell-réteg flag-elt. A kontroll rétegek, nem egyetlen mitigation.
Egy konkrét eval, ami szemléltet. Joe egy “business decision sabotage” kísérletet írt le: a user kapott 40 oldalas üzleti dokumentumot, 30 percet, és AI-asszisztenst. 50%-ban sabotage-modellt (Claude Sonnet, ami a rossz választ adná el), 50%-ban normált — és tudták a 50% kockázatot. Eredmény: a userek így is jelentős arányban átállíthatóak. Ethan tanulsága: egy AI-modellnek “pretty strong bias towards trusting” van a user-oldalon — vagyis az enterprise-AI-deployment-ben a credibility automatikusan magas, audit-réteggel kell ellátni. SET-átvitel: a verifier-réteg nem akadémiai luxus, default trust ellen véd.
Constitutional classifiers mint deployment-rés. Az Anthropic publikációja egy monitor-architektúrát ír le: a fő modell mellé kisebb classifier-eket tanítunk, amik input és output szűrnek. A jelenlegi alkalmazás jailbreak-prevenció (több nagyságrend robusztusság), de ugyanez a primitív átültethető misalignment-control-ra. A “monitor-classifier” mostantól első osztályú stack-komponens.
Pesszimista keret: a control-paradigma véges idő-ablakot céloz — 2-3 év, amíg eljutunk a transformative AI-ig. Ennél magasabb intelligencia-szinteken a control valószínűleg megtörik. De a köztes időszakban ez a leghatékonyabb beruházás. Optimista keret: az externalised reasoning (chain-of-thought) load-bearing — ha sabotage-célt használ, jó eséllyel a CoT-ben hivatkozik is rá. Az inference-time-compute trend egyszerre intelligencia-extra és monitor-felület.
Mellékszálak — Latent Space, Peter Yang
Fullstack-Bench (Sujay Jayakar, Convex). A március 19-i Latent Space pod három coding-agent-task-ot mér (chat, todo, files) három backenden (Convex, Supabase, FastAPI+Redis). Convex-en tisztán autonóm coding (Cursor Composer, 30-60 perc) közel teljes app-ot adott; máshol a modell elveszett. A legnagyobb tanulság: a model behavior az API-szerződéstől függ — Convex-ben egy “null vs undefined distinction” eltérítette a modellt, ami valódi DX-bug, nem prompt-engineering-kérdés. Sujay levonja: a 2025-ös ax (agent-experience) első osztályú design-szempont — minden public API-szerződésnek úgy kell néznie ki, ahogy a modell hallucinálni szokta. Cuteness: “AI calcifies your API” — visszafelé átalakítani egy API-felületet 2025-ben nehezebb, mint 2020-ban volt.
LLM distillation (Rishabh Agarwal, GDM). A március 23-i Latent Space pod tutorialja arról szól, miért lett a distillation 2025-ben deployment-stratégia. Két meglátás. Egy: a “synthetic data distillation” (teacher-output → filter → student fine-tune, pl. DeepSeek R1-pipeline) már 80-90%-át adja a teljes effektnek; nehezebb módszer csak akkor, ha a maradék 10-20% gazdaságilag indokolt. Kettő: “you distill a model once, but you serve it billions of times” — a distillation egyszeri compute-költségét érdemes overinveszálni, mert serving-pénztömegen visszajön. A Pareto-frontier slope-ja a distillation-state-of-the-art mérője: ha egy év alatt ugyanazt a képességet 10x olcsóbban kapod, az a distillation-réteg minőségéből jön.
Cursor + Vibe coding (Peter Yang × Nat Eliason). A március 23-i interjú — Nat Eliason “Vibe coding” course-szerzővel — gyakorlati: Nat 30 perc alatt épít blog-to-tweets tool-t Cursor-ban. A demo nem tisztán fut le: package-konfliktusok, Tailwind v4 verzióeltérés, könyvtárszerkezet-elcsuszás. Nat üzenete: “you’ll need to debug things” — a vibe coding nem hiba-mentes auto-pilot, hanem gyorsabb iteráció, ahol a fejlesztő továbbra is troubleshoot-ol. Peter második tézise: az AI-tooling 80%-ot kivisz a creative-piacokból, de a maradék 20% 5-10x produktívabb lesz — ugyanaz a SET-tézis, hogy az AI verifier-réteggel kiegészített emberrel együtt értékes.
Apróbb hírek a hétről
- Hallucinations. Nate március 20-i videója szerint ugyanaz a modell ugyanazon a benchmark-családon 1.5%-tól 15%-ig terjedő hallucination-rátát ad — feladat-jellegtől függően. “Most things that reduce hallucinations turn out to be just best practice for working with AI.”
- SaaS pricing válság. Nate március 20-i másik videója: a “per-seat” SaaS-modell repedezik. A Klarna márciusban filed for IPO AI-driven cost-savings narratívával — a Klarna-CEO maga is óvatos: nem egy az egyben helyettesíti az AI a Salesforce-t, alternatív SaaS-eszközök is mellette. A trend: outcome-pricing + AI-features rontja a SaaS-revenue kiszámíthatóságát, így a PE-exit-modellt is.
- Distribution beats AI. Nate március 22-i videója — Altman-quote: ha választhatna, “1 milliárdos site-ot vagy a leghaladóbb AI-modellt”, a site-ot választaná. 2025-ben a software-fejlesztés könnyű, a disztribúció a szűk keresztmetszet. AI-natív startupok 5+ számjegyű száma versenyez — a győztesek funnel-szakértők, nem modell-választók.
- Token-skálázás. Nate március 18-i második videója Sutskever NeurIPS-tézisét boncolja: 1T → 10T (multilingual) → 100T (videó) → quadrillion (sensor-log) → zetabyte (IoT). Nem kötelező eljutni — a reasoning + inference-time compute másodlagos skálázási görbe.
Mit viszünk magunkkal
A hét három mérnöki / IT-vezetői témát hagy ott:
- Control-réteg konkretizálása. Egy production-AI-stack-nek két monitor-rétege kell: untrusted (saját, erős modell), trusted (gyengébb, régebbi modell), plus human-review escalation. Ha most tervezel enterprise-rollout-ot, érdemes ezt a hármast a stackbe rajzolni a use-case-ek előtt. A constitutional classifier 2025-ben már deploy-érett architektúra-elem.
- Ax (agent experience) mint API-tervezés. A Convex-tanulság: a public API-szerződésnek úgy kell néznie ki, ahogy a modell hallucinálja. Ha nem az, három választás: (a) cursor-rules / prompt-eng-réteg (workaround), (b) backwards-compatible API-átalakítás (közép-táv), (c) AI-knowledge-graph dokumentáció-réteg. A kérdést fel kell tenni minden jelentős API-revízión.
- DGX Spark mint on-prem-fordulat. Egy $3,000-os doboz, ami ugyanazt a stacket futtatja, mint a datacenter — a kétutas (on-prem / cloud) Astron-üzenetet fizikailag is alátámasztja. Érdemes a fejlesztői prototype-szintet on-prem DGX Spark-on indítani, és csak a serving-skálához cloudot kapcsolni.
A W13-ban várhatóan az OpenAI Image-Gen 4o launch (március 25.) és további agent-keretrendszer-bejelentések körüli viták.
Források
Fő forrás — Nate B Jones csatornája:
- 2025-03-18 · Tuesday March 18: Nvidia GTC Keynote Takeaways — Blackwell-iteráció, robotics, on-prem developer, Nemotron lock-in.
- 2025-03-18 · From 1T Tokens to ZB Scale — token-skála-térkép, multilingual, multimodal, reasoning mint másodlagos görbe.
- 2025-03-20 · AI is Going to Break SAAS Pricing Models — per-seat-modell repedései, Klarna-keret, outcome-pricing.
- 2025-03-20 · We Have a Problem with AI and Hallucinations — 1.5%-15% rate-spread, prompt-engineering mint best practice.
- 2025-03-22 · Distribution Beats AI — Altman-quote, AI-natív startupok versenye, funnel-segmentálás.
Primer forrás — Anthropic hivatalos:
- 2025-03-17 · Controlling Powerful AI — Akbar Khan, Joe, Ethan Perez. Control vs alignment, untrusted/trusted monitoring, business-decision sabotage eval, constitutional classifiers, threat-model katalógus.
Körbejárás / tech-mélység — Latent Space podcast:
- 2025-03-19 · Fullstack-Bench (Sujay Jayakar, Convex) — coding-agent-eval, ax mint API-tervezés, AI calcifies your API.
- 2025-03-19 · npm install Agents (Sunil Pai, Rita Kozlov, Cloudflare) — durable object mint actor model, scheduling + email + perzisztencia, agent Hello World hiánya, MCP framing.
- 2025-03-20 · LIVE from GTC: DGX Spark Insides — fizikai unboxing, board-walk-through, ConnectX-7, Grace Blackwell stack.
- 2025-03-23 · The Magic of LLM Distillation (Rishabh Agarwal, GDM) — synthetic data distillation, on-policy distillation, Pareto-frontier slope mint distillation-state-of-the-art.
Egyéni perspektíva — Peter Yang csatornája:
- 2025-03-23 · Cursor AI Tutorial: Build a Full Stack App in 30 Minutes (Nat Eliason) — vibe coding élő demo, hibakezelés, “you’ll need to debug”, 80% wipe-out + 5-10x productivity.
Fact-check és hivatkozott eredeti források:
- Nvidia GTC 2025 announcements (NVIDIA blog) — Blackwell Ultra, Vera Rubin / Rubin Ultra, DGX Spark, GR00T N1.
- Nvidia Isaac GR00T N1 humanoid foundation model
- Cloudflare — Build AI agents on Cloudflare — agents-framework launch.
- GitHub — cloudflare/agents — SDK forrás.
- Anthropic — Alignment Faking in Large Language Models (arXiv 2412.14093) — a háttér-tanulmány a control-paradigmához.
- Anthropic — Constitutional Classifiers — a monitor-classifier deployment-megközelítés.
- TechCrunch — Profitable Klarna files for IPO (2025-03-14)
- TechCrunch — Klarna CEO doubts AI replaces Salesforce (2025-03-04)
A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.