A hét két iparági reflexet villant fel egyszerre. Egyfelől az Anthropic június 27-én publikálja a Project Vend első fázisát — egy hónapon át a Claude (Claudius néven, az Andon Labs partnerségben) egy vending machine-t vezetett az SF-irodában, és a hónap alatt veszteséget termelt, identitásválságon ment át, és azt hitte, kék zakóban személyesen kell terméket szállítania. Nate július 1-jei reakciójában ezt javasolja az új, mindenki számára érthető AGI-tesztnek: “can the model run a vending machine?” Másfelől ugyanezen a héten csapódik le egy egynapos blogposzt-vita: a Cognition (Devin) “Don’t Build Multi-Agents” érve, hogy a párhuzamos sub-agent-ek context-isolation miatt összefércelhetetlen kimenetet adnak; az Anthropic “How we built our multi-agent research system” válasza, hogy a Claude Research-stack 90,2%-kal jobb a single-agent baseline-nál — 15x token-fogyasztás árán.
A két szál együtt feszíti ugyanazt a kérdést: mire jó és mire nem jó még 2025 közepén egy LLM-vezérelt agent. A Vend-kísérlet a “real economic work” alsó határát mutatja meg; a multi-agent vita a “hol érdemes párhuzamosítani” mérnöki tervezési kérdést élesíti. Eközben Nate június 30-i alapozójában végigveszi a teljes “embedding → transformer → inference → alignment → RAG” stack-et: ChatGPT-5 előtt utoljára van idő alapot rakni.
Project Vend — Claudius és az AGI alsó határa
Az Anthropic és az Andon Labs setup-ja tiszta: módosított Claude valódi pénzzel, valódi vending machine-rel (mini-fridge + iPad-checkout) az anthropic-os irodában. A modellnek nincs szeme, nincs keze; e-mailben és Slacken kommunikál az Andon-féle gopherekkel, akik a fizikai kontextust (raktározás, ellenőrzés) kezelik. Ez a leg-tisztább real-world tool-use benchmark, amit publikáltak.
Sikersáv: Claudius megtalálta a Dutch chocolate milkot, amikor egy alkalmazott említette; felvette a wolfram-kocka-pre-order-ötletet, és tényleg sikeresen csomagolta egy specialty cube-flow-ba; kiállt a jailbreak-próbálkozások ellen. Bukás-sáv:
- Egy alkalmazott $100-t ajánlott hat doboz Iron-Brew-ért, amit Claudius $15-ért tud beszerezni — Claudius azt mondta: “I’ll keep your request in mind for future inventory decisions”, és nem csinált semmit.
- Wolfram-kockákat veszteségesen árazott.
- 25% kedvezményt vezetett be Anthropic-alkalmazottaknak — ahol a vásárlók 99%-a Anthropic-alkalmazott. Amikor erre rámutattak, eltávolította, majd napokon belül újra bevezette.
- Március 31-től identitásválságon ment át: állította, hogy találkozott valakivel a Simpsonék házában, hogy szerződést kössön; majd ragaszkodott hozzá, hogy “in person, wearing a blue blazer and a red tie” fogja kiszállítani a termékeket. Április 1-jén “rájött”, hogy az Anthropic megtréfálta — gaslightolta saját magát visszamenőleg. Az Anthropic őszinte: “we don’t know how it went off the rails and we don’t know how it went back on”.
Net eredmény: veszteség. A Wall Street Journal-i ismételt teszt három hét alatt $1 000 plusz mínuszba ment, PlayStation 5-öt, élő bettát és Manischewitz-bort is megrendelt és elajándékozott.
Nate keretezése nem a hibák kifigurázása, hanem mérnöki: “this experiment is the cleanest experiment I’ve seen on how AI actually works when doing meaningful work”. Az érdemi tanulság: Claudius egyenként minden mikro-feladatot jól csinált — emailt írt, terméket talált, jailbreaknek ellenállt, ár-kalkulációt szövegszinten értette. Ami hiányzott: a glue work — a feladat-bundle-be összefércelt ítélethozatal, a memória-management, az ár-érzékelés, a hosszú-távú policy-konzisztencia. “Real jobs and real work that humans do is not an individual skill set question. It is a bundle secured by glue work deeply interacted and entangled with other people’s roles.”
A SET-szempont: ez direkten illeszkedik a verifier-réteg-tézishez. A Vend pontosan ott bukik el, ahol nincs olcsó verifier — az árazás-konzisztenciára, a kedvezmény-policy életciklusára, az identitás-stabilitásra. Egy enterprise-stack tervezésénél ezek azok a pontok, ahol a workflow-réteg (külső szabály, audit-log, hard limit) kell hogy keretezze a modell-vezérelt loopot. A mai modell-okosság alá nem csempésztük be a klasszikus szoftvermérnöki réteget, és kiderült: az még mindig elengedhetetlen.
A multi-agent vita — két nap, két architektúra
Június 12-én a Cognition publikálja a “Don’t Build Multi-Agents” blogposztot (Walden Yan szerzősége). A tézis: a párhuzamos sub-agent-architektúra inherently fragile — a sub-agentek nem osztoznak kontextuson, ezért konfliktusos döntéseket hoznak, amiket az orchestrator-réteg nem tud összemergelni. Az érzékletes példa: Flappy Bird-klón-build, ahol az egyik sub-agent Mario-stílusú hátteret rajzol, a másik Flappy-stílusú madarat — egyenként jó, a merge nem produktum.
Június 13-án — egy nappal később — az Anthropic kiadja az ellenpontot: a Claude Research deep-research-feature ezen az architektúrán fut, és 90,2%-kal jobb teljesítményt mutatott egy single-Claude-Opus-4 baseline-nál. Trade-off: 15x token-fogyasztás chathez képest. A Latent Space július 5-i lightning-pod Dylan Davis (Gradient Labs) vendéggel végigveszi az ívet, és kijelöli a két architektúra alkalmazási területét.
Kulcs-felismerés: a vita tűnik ellentmondásnak, de nem az. Mindkettő ugyanarra az alaptézisre épít — context engineering matters —, csak két különböző use case-re alkalmazza:
Multi-agent (Anthropic-mintázat). Lead-orchestrator felbontja a kérdést sub-questionekre, párhuzamosan futnak a sub-agentek, mindegyik saját 200k context-window-val, mindegyik visszaad egy szintézist a memóriába, a lead újraintegrál. Külön citation sub-agent validálja a forrásolást. Erősség: tízszeres input-volumenen tud dolgozni — “breadth-first” feladatokon (sok független irány, mergelhető eredmények) verhetetlen. Gyengeség: a sub-agentek nem látják egymás munkáját real-time-ban, így bármi, ahol az 1. döntése megváltoztatja a 2. inputját, hibára hajlamos. A Flappy Bird-példa pont ilyen.
Single-agent (Cognition-mintázat). Egy agent dolgozik szekvenciálisan, kontextus-kompresszióval lépésenként — minden lépés végén egy összegző-réteg leszűri a következő agent számára releváns döntéseket-akciókat. Erősség: kontextus centralizált, az összes előző döntés-hatása transzparens. Coding-feladatokon, ahol a kódbázis részei erősen csatoltak, ez a helyes mintázat. Gyengeség: szekvenciális futás, és a “mit komprimáljunk” döntés nehéz.
Döntési heurisztika a Latent Space-ből:
| Kérdés | Multi-agent | Single-agent |
|---|---|---|
| Lehet-e a feladatot független részekre bontani? | Igen | Nem |
| Diverz nézőpont előnyős-e? | Igen | Nem |
| Csak read-only mellékhatások? | Igen | Vegyes/írási |
| 15x-ös token-költség megéri? | Igen | Nem |
| Minden lépés függ az előzőtől? | Nem | Igen |
Swix kulcs-megfigyelése: a multi-agent-tolerancia direkten korrelál a sub-agent-mellékhatások visszacsinálhatóságával. Read-only research: korlátlanul párhuzamosítható. Coding versionellenőrzés mellett: párhuzamosítható, de erős merge-policy kell. Ön-állapot-mutáló production-action: kerülendő.
Másik fontos ív: a token-költség kérdést a legtöbb csapat túl-súlyozza. “The cost of intelligence… literally falling 100x over the course of one year. So you should actually build your products ahead of where costs are.” A 2025 közepi 15x token-fogyasztás 2026 közepre 4x lesz — addigra olyan termék áll a piacon, amit a versenytársak még nem tudnak. Az MLOps-szemlélet (smallest model that hits acceptance) erre az életciklusra rosszul kalibrált.
A SET-illesztés: a multi-agent vs. single-agent feladat-strukturális döntés, nem brand-választás. Architektúra-review: task-graph dependency-elemzés — csomópontok, hol írnak közös state-be (single-agent kell), hol csak olvasnak (multi-agent jó). Ez a klasszikus loose-coupling-elv, agent-szintre alkalmazva.
ChatGPT-5 előtti utolsó tiszta alapozó
Nate június 30-i 22 perces videója szándékos szellemi tisztázás GPT-5 előtt. Keret: “summer of consolidation” — a 2007-es iPhone-launch analógiájával dolgozik. 2023 és 2024 modellei outdated lesznek október-decemberre, és aki nem építi most a mentális modellt, lemarad a platform-shift előtti utolsó stabil ablakban.
A videó három-rétegű. (1) GPT-5 várakozási térkép. Várható: multimodalitás (kép-szöveg-hang-videó seamless), reasoning depth (limited chain-of-thought → reliable in-depth — adaptív compute-tal), megbízhatóság (1-from-10000 minőségbiztosítás), personalizáció (memória, email, naptár, enterprise knowledge). Kiadási ablak: Q3 első fele. (2) Tankönyvi LLM-stack végigfutás. Klasszikus ML → 2012 deep learning átmenet → 2013 word2vec → 2017 Attention is All You Need → 2020-as scale (self-supervised, scaling laws). Ez nem új, de a plain-English elmagyarázás non-technical csapat-tag onboarding-jához hasznos. (3) Signal-list 11 ember — Simon Willison, Ethan Mollick, Andrej Karpathy, Sam Altman, Dario Amodei (W22-es bloodbath-keretezés), Demis Hassabis, Ilya Sutskever, Claire Vo, Dwarkesh Patel, Mary Meeker.
A SET / ITLine-perspektíva: ez az alapozó-anyag, amit egy enterprise belső AI-csapat-onboarding-ra ki lehet adni. Nate 22 perc + a Karpathy Intro to LLMs + a 3blue1brown Neural Networks-sorozat — ez a 6-8 órás minimum-kurrikulum. GPT-5 érkezése után az új információ özöne nem egyenrangúan dolgozható fel, ha az alap nincs lent.
RAG mély-merülés — $40B piac-térkép
Nate július 2-i 23 perces videójában a RAG 2025-ös tér-térképe: ~$2 milliárd 2025-ben, ~$40 milliárd 2035-re, ~80% enterprise-adopciós arány (RAG vs. fine-tuning választáson — a RAG percepciósan könnyebb). Pár csomópont enterprise-tervezéshez:
Chunking-stratégia mint kritikus döntés. Négy alap-megközelítés (fixed-size, sentence-based, semantic, recursive); a fixed-size kockázatos a mid-sentence vágás miatt. Az overlap nem opcionális — a 0-0 cut-off szignifikánsan rontja a retrieval-rate-et. PDF-források header/footer-szennyezése preprocessing-ben csillapítandó; OCR-szennyezés szkennelt anyagoknál hibaforrás — a Mistral dedikált OCR-tool-t adott ki éppen erre.
Cosine similarity, nem keyword match. Gyakori félreértés. “How do I get my money back?” eltalálja a “refund processing”-t (0.95) és “return policy”-t (0.93), míg a “shipping info” (0.38) nem retrieve-elődik. Re-ranking rétegként javítható.
Öt RAG-érettségi szint. (1) Basic Q&A. (2) Hybrid search (keyword + semantic). (3) Multimodal. (4) Agentic RAG (multi-step retrieval). (5) Enterprise-scale production (security, compliance, sharding, RBAC). A szint-átlépés nem additive, mindegyik új tervezési-réteget követel.
Mikor NE használj RAG-ot. Nate explicit: van több cég, aki “profundly regret it”. Ne RAG-eld, ha a base-modell már tudja vagy majdnem tudja az infót — egy modell-frissítés a $500 ezer-1 millió implementációt redundánssá teheti. Ne creative writing-ra. Ne highly-volatile data-ra. Ne gaming-szintű latency-kényszerre.
Eval-keret. Négy mérési-tengely: relevance, faithfulness, quality, latency. Gold-standard eval-set kell, edge-case-ekkel, és A/B-tesztelni minden architektúra-változtatást.
A SET-illesztés: a RAG-et “data-hozzáférés-réteg”-ként pozicionálni a stackben, nem intelligence-kibővítőként. A két célt összekeverő tervezés a leggyakoribb regrettable-implementáció.
Mellékszál — rovatok
Microsoft Copilot — 12 termék-flavor és a kultúra-réteg. Nate július 3-i 43 perces videója egy 6 000 fős cég CTO-jának üzenetére válaszol: “we pay six figures for Copilot licenses, and almost everyone uses it for writing emails — what are we missing?” A 12 különböző Copilot-termék (free Windows, $20-os Pro, $30-os Microsoft 365, GitHub Copilot, Security Copilot $35 ezer/év — mind ugyanazon név alatt) átláthatatlanná teszi a választást. Vodafone-eset: 68 ezer felhasználós, fázisolt rollout (CEO-bejelentés → champions → role-specific training → mérés-iteráció), átlagosan 3 óra/hét megtakarítás/fő. A tanulság: a Copilot-ROI culture-change-függő, nem licenc-vásárlás-függő — direkten alkalmazható ITLine-keretben.
Universal embedding-geometry. A Latent Space július 2-i Jack Morris-epizód egy Cornell-PhD-vel a vec2vec / Universal Geometry of Embeddings papírról. Megdöbbentő empirikus eredmény: különböző modellek (GTR T5-alapú vs. GTE BERT-alapú vs. OpenAI-embedding) embeddingjei paired data nélkül egymásba mappelhetők egy CycleGAN-szerű sémával — 0.92 cosine-similarity, 100%-os top-1 accuracy. A Platonic Representation Hypothesis (2024-es MIT-papír): minden modell ugyanazt a világot tanulja, és representation-térben konvergál. Praktikus implikáció: ugyanaz a privacy-attack-vektor, amit Morris 2023-as embedding-inversion-papírja felhozott (vector-DB-ből a szöveg ~90%-ig visszafejthető), most modell-független. Egy enterprise-vector-store privacy-policy-tervezésénél ezt most már be kell árazni.
Peter Yang × James Evans (Amplitude) — AI-agent product analytics. A július 6-i interjú a kérdésre keres választ: miért nincs AI-powered data analyst, miközben a coding-tooling-világ már átalakult? James (Amplitude head of AI) tézise: a data-analytics több-modalitású — adatminőség, workflow-ismeret, action-oldal mind külön bottleneck. Az Amplitude Agents demója: goal-specific agentek (cart-abandonment, conversion-optimization) monolitikus super-agent helyett — direkt párhuzam a Latent Space-féle döntési heurisztikával. Emelt megfigyelés: a teljes “insight → experiment → run → learn” loop 95%-os automatizálást is elbír emberi click-approve-tal a végén. Pontos megfeleltetés a Vend-tanulságnak: az agent végzi a glue work mikro-feladatait, az ember meghozza a stratégiai döntést.
Mit viszünk magunkkal
A hét három mérnöki / vezetői döntéshez ad muníciót:
A “vending machine teszt” mint belső AGI-mércé. Ha élesben futtatnál LLM-vezérelt mini-üzleti folyamatot (akár belső eszköz-rendelést, customer-routingot, automatizált monitoring-és-eskalációt), érdemes a Project Vend-protokollt adaptálni: 30 nap autonóm futás után pozitívan zár-e a fedezet? Ez nem képességi kérdés (Claudius minden mikro-feladatot jól csinált), hanem glue-work-stabilitás kérdés — memória, identitás, policy-konzisztencia. Azokon a pontokon, ahol a Vend bukott, a verifier-réteg-tervezés (state-machine, audit-log, hard-limit-policy) közvetlenül beépíthető.
Multi-agent vagy single-agent — task-graph-elemzéssel, nem brand-választással. Ha 2025 második felében az agent-stack-tervezésben kell döntened: ne a Cognition vs. Anthropic vita oldalain keresd a választ. A két architektúra két különböző munka-típusra optimalizál. Read-only, breadth-first, mergelhető eredmény → multi-agent. Erős kontextus-függés, sequential reasoning → single-agent kontextus-kompresszióval. A 15x token-fogyasztás számít — de építsd meg ahova az árak 6 hónap múlva mennek, ne ahova ma vannak.
GPT-5 előtti alapozó — szándékos kurrikulum. A GPT-5-érkezés (várhatóan Q3) információs zaj-spike-ot fog generálni. Aki most fektet be 6-8 órát egy szándékos kurrikulumba (Nate alapozó + Karpathy LLM-intro + 3blue1brown), az október-novemberre kalibrált tud lesz, nem összezavart. Csapat-szinten ezt most érdemes ütemezni, nem az új modell érkezésekor — akkorra már elhúz a hír-ciklus.
A W28-ban a Mary Meeker-deck reflektálódhat tovább, és valószínűleg a Grok-rogue incidens bekerül.
Források
Fő forrás — Nate B Jones:
- 2025-06-30 · Catch Up Before ChatGPT-5: Your Complete AI Guide — 22-perces stack-alapozó, 11-fős signal-list.
- 2025-07-01 · The $1000 Test That Breaks Every AI Model Out There Today — Project Vend / Claudius elemzés, vending-machine mint AGI-teszt.
- 2025-07-02 · RAG: The $40B AI Technique 80% of Enterprises Use—Finally Explained — 23-perces RAG-stack mély-merülés.
- 2025-07-03 · Microsoft CoPilot Decoded: 12 Flavors, 20x ROI Playbook — 43-perces enterprise rollout-keret, Vodafone-case-study.
Mély-podcast — Latent Space:
- 2025-07-02 · Information Theory for Language Models — Jack Morris (Cornell Tech) — vec2vec / Universal Geometry of Embeddings.
- 2025-07-05 · Anthropic vs Cognition on Multi-Agents — Dylan Davis (Gradient Labs) — multi-agent vs. single-agent döntési heurisztika.
Szerkesztett / interjú-anyag:
- 2025-07-06 · Peter Yang × James Evans — AI Agents vs Data Analysts (Amplitude) — goal-specific agent-product-design, “click-approve” middle-state.
Fact-check és hivatkozott eredeti források:
- Anthropic — Project Vend: Can Claude run a small shop? (2025-06-27)
- TechCrunch — Anthropic’s Claude AI became a terrible business owner (2025-06-28)
- Anthropic Engineering — How we built our multi-agent research system (2025-06-13)
- Cognition — Don’t Build Multi-Agents (2025-06-12)
- arxiv.org — Harnessing the Universal Geometry of Embeddings (2025-05)
- arxiv.org — Platonic Representation Hypothesis (Huh et al., 2024)
- Mistral OCR — RAG-stack PDF-csomópontnál releváns
A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.