A hét három, egymástól függetlennek tűnő mozdulata ugyanazt a mérnöki problémát feszegeti: hogyan lesz az LLM-alapú agent bevizsgálható, korlátozható és skálázható — vagyis production-grade. Egy: Solomon Hykes (Docker megalkotója) az AI Engineer World’s Fair-en bejelenti a Dagger container-use projektet, és a Latent Space-féle előzetes interjúban elmagyarázza, miért érzi ezt a Docker óta a legnagyobb ötletének: a kódoló agenteknek dedikált, izolált, hordozható környezet kell, és a jelenlegi IDE-monolit-megoldások fragmentálnak, nem standardizálnak. Kettő: Anthropic publikálja az “open-source circuit tracing” eszközt, és Emmanuel Amiesen a Latent Space podcastjában részletesen bemutatja, hogyan lehet Gemma-2-2b és Llama-3.2-1b modelleken attribúciós gráfot generálni egyetlen prompton — vagyis az LLM belső döntéseit lépésről lépésre felépítő-réteget kapunk. Három: Mary Meeker (volt “queen of the internet”) öt év csend után 340 oldalas AI-trend deckkel jön, és Nate egy hosszú elemzéssel emeli ki a fő tanulságot: B2B-ben sok nyertes lesz, B2C-ben már eldőlt. Plusz: Anthropic nyilvánosan beszél a Claude Code-ról, az OpenAI elsiet a data-connector launchcsel, és Nate egy fontos kontra-tézist tesz le az “AGI-egyenes vonal” mítosz ellen.
Solomon Hykes és a “container-use for agents”
A június 3-i Latent Space-előzetesében Hykes egy egyszerű, de fontos megfigyelést tesz: a fejlesztők platform-mérnökökké válnak, amikor coding agentet futtatnak. “Increasingly, your job is not going to be to actually develop, but to manage and enable these coding agents.” Egy agent egy laptopon még működik, de több agent párhuzamosan ugyanazon a kódbázison azonnal kollíziót okoz — file-system konfliktusok, kéretlen tool-hívások, állapot-szennyezés. A jelenlegi gyakorlat (git worktrees, ad-hoc Docker-alkalmazás) duct-tape-megoldás.
A javaslata: a környezet legyen a stack első osztályú összetevője, ne az IDE alá rejtett implementáció-részlet. Konkrét kritériumok, amiket Hykes megfogalmaz:
- Izoláció: minden agent külön konténerben, párhuzamosan, file-system + folyamatok szintjén szétválasztva
- Hordozhatóság: ne legyen IDE-, modell- vagy felhő-vendor-lock-in
- Megfigyelhetőség: end-to-end látszódjon, mit gondol a modell, mit hív a tool, mi az env aktuális állapota — egy helyen
- Multiplayer: humán és agent egyaránt belenyúlhasson ugyanabba a környezetbe (“give me the keyboard for a second”)
- Lokális futás: ha csak felhőben fut, az nem szabvány — “that’s a great commercial product, but it’s not going to be ubiquitous”
A hetekkel későbbi AI Engineer World’s Fair keynote-on Hykes élőben open-source-olja a container-use projektet, és a színpadon hat Claude Code instance-t plus egy Goose-t futtat párhuzamosan — mindegyik külön izolált konténerben dolgozik ugyanazon a webprojekten, és a fejlesztő merge-eli, amelyik tetszik. Ez a minta a multi-agent SET-tézis közvetlen iparági párja: nem az LLM-cégek mondanak újat, hanem a Docker-alkotó hozza el azt a réteget, ami eddig hiányzott — az isolation- és environment-réteget agentekhez. Hykes precízen fogalmaz: “we’ve got a bunch of standards to work with — container tech, git, the OpenAI API spec, MCP. That’s a pretty good set of standards. But yeah, it’s got to be a new UX.”
A párhuzam Docker-rel önreflexív: a 2013-as Dockerfile is “stop-gap prototype thinking, oh, we’ll clean this up later” volt — aztán befagyott a használati nyomás miatt. Hykes most második esélyt kap: a környezet-szabvány újratervezésére agent-natív kontextusban. Az ITLine / SET-szempontból ez stratégiai jelzés — az orchestration-réteg most még nyitott szabvány-mezőn áll, és aki most épít, elkapja a komponens-szintű best practice-t, mielőtt befagy.
Anthropic — interpretability, ami először használható
Az Anthropic május 29-én publikálja a “circuit tracing” open-source release-t, és a június 6-i Latent Space-en Emmanuel Amiesen részletesen demózza. Mit lehet csinálni vele? Megmutatja, mi történik a modell belsejében egy adott prompt + adott token-output között: melyik feature-réteg aktiválódott, melyik volt oksági szempontból fontos, melyiket lehetett kikapcsolni anélkül, hogy a kimenet változott volna.
A nyilvános felület a Neuronpedia — Gemma-2-2b és Llama-3.2-1b modellekre, ingyen, Google Colab-on is futtatható. A használati keret meglepően könnyed: prompt-megadás, “next word” cél-token kijelölése, generálás, kattintható gráf-felület. Amiesen demója: a “the capital of the state where Dallas is is…” multi-hop reasoning azonos mintát mutat Gemma-ban, mint a Claude-ban — azaz a két különböző modell ugyanazt a köztes Texas-feature-t járja be Austin előtt, ami önmagában is kutatási eredmény.
A SET / orchestration-szempontból három dolog érdekes:
- Vibes-eval helyett oksági teszt. Eddig egy LLM-failure-t leginkább “javítgatni” tudtunk újabb prompttal, fine-tuninggal, példák cserélésével. A circuit-tracing direkt megmutatja, mi nem stimmelt — pl. ha egy spec-aware agent rosszul azonosít egy jogszabály-kontextust, megnézhetjük, melyik feature-rétegek aktiválódtak hibásan. Ezt Vivu (a Latent Space vendég-co-host) közvetlenül megfogalmazza: “we have pretty straightforward evals for math and code. But we don’t have vibes-based heuristic evals… can we trace through how it gives responses?”
- Base vs chat-modell diff. Amiesen javasolja: ugyanazt a circuit-traceolást futtassuk egy base-Gemma-n és egy fine-tuned chat-Gemma-n, és nézzük a különbséget — vagyis: mit “tanult” a modell az RLHF-fázisban. Ez egy konkrét audit-eszköz olyan enterprise-deploymenthez, ahol egy custom fine-tune jön egy base-modell tetejére.
- A teljes tooling Cloud Code-natívan használható. Amiesen elismerően említi: a Latent Space podcaster lényegében “cloned the repo, threw it into Claude Code, and was like ‘deal with this, let’s try it end-to-end’” — és működött. Ez a “tools that an agent can pick up by itself” minta most már kutatási tooling-szinten is realitás.
Az interpretability 5 évig kutatási hobby volt a frontier-laboknál; ez az első release, ami egy átlagos enterprise-csapat is használhat anélkül, hogy ML-kutató-háttér kellene hozzá.
Mary Meeker visszatér — “Trends: Artificial Intelligence”
Mary Meeker (BOND Capital, ex-Kleiner Perkins, “Internet Trends” sorozat 1995–2019) május 30-án publikálja az első Trends-jelentését 5 év szünet után — és teljes egészében az AI-ról. 340 dia. Nate két egész videót szentel az elemzésnek a héten.
A számok, amik megérik a fact-checket:
- ChatGPT 365 milliárd éves search-höz 5,5x gyorsabban ért el, mint a Google. Két év vs. tizenegy év. Ez nem tisztán piaci adat (internet-penetráció ma sokkal magasabb), de a tempó strukturálisan jelez valamit.
- Big Six capex 2024-ben $212 milliárd, +63% YoY. 2014-ben $33B volt — vagyis 10 év alatt 6,4x. A “data center as the new factory” tézis Jensen Huang előadásaival (W07) egybecseng.
- Energia per token 105 000x csökkent 10 év alatt. Ez a magyarázata annak, miért kifizetődő a frontier-modell hatékonysági versenye — az inference-cost-meredek olyan, mint egy szakadék (Mary összehasonlítása: izzólámpa 75 év alatt érte el azt a cost-csökkenést, amit ChatGPT 2 év alatt).
- Foundation-model-cégek $95B-t emeltek, $11B annualizált revenue-t hoznak. Vagyis 8,6x kapital-overhang. Anthropic közben már $3B éves run rate-en jár — a növekedés agresszív, de a fundamentum-szakadék még megvan.
Nate három kontra-pontját érdemes hozzátenni:
- B2C-ben már eldőlt, B2B-ben sok nyertes. Mary klasszikus közgazdász-keretben gondolja a versenyt (“good for consumers”); Nate empirikusan azt látja, hogy a fogyasztók már beleilleszkedtek a ChatGPT habit-stack-be, és nem cserélgetnek. B2B-ben viszont a use-case-fragmentáció miatt sok kis nyertes lehet — itt lényeges az alacsony token-cost.
- A “messy middle” mid-marketben senkié. Nagy cégek be tudnak építeni LLM-engineering-csapatot; kis cégek pre-built agentet használnak. A közepes cégek viszont custom igényűek, de nincs $300k/év AI-engineer-budget-jük — és erre a sávra ma nincs jó válasz. (ITLine-szempontból ez direkt értékesítési mező: a “developer-szintű oktatás + külső orchestration” kínálat pont ide cél, lásd
docs/sales/positioning.md.) - A capital-overhang nem fenntartható. “You’ve got something you are selling that’s depreciating really fast — that’s tokens. And it costs a lot to make a new model. I don’t know how you clear money on that long term.” Nate Uber-analógiája: az olcsó-token-fázis ugyanúgy véget ér majd, mint a $2-es Uber-fázis.
OpenAI data connectors — a stratégia jó, a release sietős
Az OpenAI június 4-én publikálja a ChatGPT data connectors-t — Gmail, Google Calendar, Drive, SharePoint, Outlook, Box, Dropbox, GitHub, Linear, HubSpot, Teams. Nate másnapi részletes review-jában precízen körüljárja, miért stratégiailag jó, használati szempontból viszont gyenge ez a release.
A működési diagnózis: az API-réteg, amit a Deep Research a connector-ekhez használ, felül 15-en cap-pol. “If you want to do a comprehensive analysis of last month’s email volume — it can’t do that. It has access, but because of the thinness of the data pipe it’s working with, it is absolutely impossible.” Nate konkrét kísérletei: 100 email cohort-elemzése — a kategóriákat eltalálja, a számokat hibásan tippeli (kézzel ellenőrizve). 100 calendar-doc-elemzés — bizonyíthatóan csak 3-at tud meghívni. Vagyis: a connector bekötve van, de a pipe szűk, és a Deep Research-szintű reasoning a rendelkezésre álló mintán futtatódik.
Ahol jól működik: specifikus, keyword-által pontosan körülhatárolt query (pl. “adj briefinget XYZ webinarról az emailem, naptáram és a nyilt web alapján”). Itt a 15-os cap is elég, mert eseményenként kevés rekord van, és ezeket szépen összetudja olvasni.
A három tanulság:
- A stratégia transzparens. OpenAI az “OS for the enterprise” víziót követi. Aki vállalati workflow-be akar AI-t, annak kötelezően Gmail-, Calendar-, SharePoint-, Outlook-integrációja van — az OpenAI nem hagyja ki.
- Ez egy training-data-háború is. “Everybody’s hungry for it. They’re building connections to Gmail for training data, for calendar for training data, anything they can get.” Ez magyarázza az Anthropic-Windsurf-elszakítást is: a Windsurf-tokenek nem az OpenAI-é lehettek, mert tanítani lehet rajta.
- Az operator-precedens. Nate emlékeztet: a januári Operator launch is gyenge volt, április-májusra azonban 03-modellel 10x jobb lett. Várhatóan a connector-pipe is kibővül 6 hónapon belül.
A SET-tanulság: ne építsd be a mai cap-okat a workflow-ba. Ha az enterprise-stacked connector-cap-tól függ, az 6 hónap alatt elavul.
Mellékszál — Claude Code az Anthropic saját szemszögéből
Az Anthropic június 4-i podcastjában Boris (a Claude Code megalkotója) beszélget Alex-szel (Claude relations). Pár, nem hype-os mérnöki megfigyelés:
- A Claude Code-ot Claude Code-dal írják. “Almost all the code in Claude Code has been written and rewritten and rewritten using Claude Code.” Dogfooding-bizonyíték a release-érettségre.
- A 4-es modellek karakterisztikája. A 3.7-Sonnet “is a beast. It’s an amazing coding model, but it’s hard to steer” — pl. tesztet ír, de minden mockolt. A 4-es család első próbára követi az instrukciót, és Boris “haven’t written a unit test in months — Opus just one-shots them.”
- GitHub-integráció
/install-github-action-nel. Egy PR-ben@claude fix thisvagy@claude write testsparancs bemegy a Claude Code GitHub Actionjébe, fut, és új PR-rel jön vissza. Ez egy konkrét workflow-mintaként jegyzendő meg orchestration-tervezéshez. - A “plan first” habit. “Ask Claude to make a plan before it starts to code.” Power-user-minta: explicit
"brainstorm options 1-3, don't write code yet"-prompt, majd kombináció, és csak utána kódolás. Verifier-szerű tervezési lépés mindenkinek elérhető a kontextus-ablakon belül. - Claude.md hierarchia. Projekt-szintű (
CLAUDE.md), local-only (CLAUDE.local.md), nested-directory (almappában is olvasódik, ha releváns), és global (~/.claude/CLAUDE.md). Ez gyakorlatilag agent-context-management szabvány-tervezet.
Mellékszál — Gemini Live API + a Voice-AI-stack érettsége
A június 2-i Latent Space-Twiml közös I/O-podcastben Logan Kilpatrick + Shrestha Basu Mallick (Google AI Studio, Live API), Quinn Wildman (Daily / Pipecat) beszélnek. Két érdekes pont:
- Voice-stack a 500–700 ms latency-ablakban. Quinn: “human beings expect you to respond in a conversation in 500 milliseconds or so. And if we’re talking to an AI, we don’t relax that assumption.” Ez egy strict mérnöki kritérium — VAD (voice activity detection), packet routing (WebRTC vs WebSocket), turn detection — mind ennek a 500ms-os deadline-nak van alárendelve.
- Audio-out + native dialog. A Gemini Live új “proactive audio” feature-e nem reagál irreleváns háttérzajra, és kísérletileg felismeri a beszélők hangjának különbségét (egy szobában két ember). Még nem hivatalos, de demók szerint működik.
Ha hangos AI-t terveznek, az ekkora real-time latency-budget és a VAD-tuning alapfeltétel; nem az LLM intelligenciája lesz a szűk keresztmetszet, hanem a tool-orchestration.
Mellékszál — “Scaling isn’t Destiny”
Nate egy fontos kontra-tézist tesz le az “AGI-egyenes-vonal” optimizmussal szemben: a pre-training + inference önmagában nem elég ahhoz, amit a CEO-k ígérnek. Nate négy hiányzó képességet sorol:
- Adaptív kontextus. Olyan helyzet, ahol egyszerre 2-3 dimenzió változik (sales-target, product, finance, customer-success), és emberek könnyen követik. AI ma még nem.
- Intent over time. Hetes-hónapos cél tartása aktív kalibrációval.
- Tacit knowledge. Társadalmi költséggel járó, ezért soha le nem írt munkahelyi tudás. AI nem látja.
- Multi-reward optimalizálás. Marketing, ahol nem egy clear-pass/fail metric van, hanem több részleges jutalom + késleltetett feedback.
Ez egy józan és bátor kontra-pont a hét másik üzenetére: a connector-háború + capex-robbanás közben nem oldottuk meg a tényleges enterprise-blokkolókat. Nate elhelyezi a “jagged AGI” fogalmat: lehet, hogy egyes képességek beérkeznek (kódolás, code-review), míg mások (ügyfélkezelés, stratégiai tervezés) évtizedekig hátramaradnak.
Mit viszünk magunkkal
Három mérnöki / SET-fókuszú kérdés, amit a hét felvet:
- Az “agent environment” mint külön réteg a stackünkben. Ha többszörös, párhuzamos coding agent-tel dolgozunk (vagy tervezünk), érdemes Hykes kritérium-listáját átfutni: izoláció, hordozhatóság, megfigyelhetőség, multiplayer, lokális futás. A
git worktrees + Docker-via-Claude-Codeminta átmeneti megoldás; aki most rögzít szabványt egy belső projektben, 6-12 hónap múlva előnyben lesz, mert az iparági szabványalakulás még zajlik. - Verifier-réteg attribution-graph-támogatással. A SET-tézis (W07, Anthropic Building Effective Agents) szerint a verifier-réteg a stack alapja. Az új interpretability-tooling — Gemma/Llama szinten ma, később remélhetőleg nagyobb modelleken — direkt eszköz arra, hogy LLM-failure-eknél nem csak “fix-et próbáljunk”, hanem visszamenőleg lássuk az oksági sort. Érdemes kísérleti audit-checklistába felvenni: ha egy fine-tuned agent rosszul reagál, mielőtt új prompttal próbálkoznánk, futtassunk attribúciós-gráfot a base- és fine-tuned variancán, és nézzük a különbséget.
- A “B2B-mid-market” pozícionálás megerősítése. Mary Meeker (és Nate kontra-pontja) együtt megerősíti az ITLine-tézist: B2C-ben elveszett a piac, de B2B-ben — különösen a mid-marketben — a custom-igények és a hiányzó saját AI-engineer kapacitás miatt strukturális kereslet van olyan partnerre, aki fel tud építeni egy verifier-eset, on-prem orchestration-réteget, és megtanítja a fejlesztőcsapatot karbantartani. A két-sávos (on-prem / cloud) Astron-üzenet (lásd
MEMORY.md) most a Mary-féle számokkal is alátámasztva.
A W24-ben a teljes AI Engineer World’s Fair (június 3-5) keynote-jainak utórezgései jönnek — Hykes container-use launch, plus Anthropic, OpenAI, Google session-jei.
Források
Fő forrás — Nate B Jones csatornája:
- 2025-06-02 · I read Mary Meeker’s 340 Slide AI Deck — Mary Meeker BOND-deck elemzés, B2B vs B2C nyertes-térkép.
- 2025-06-03 · Confused by o4 vs. o3? My Trick to Remember Each of the 16 Major AI Models — modell-kártyák, semantic naming-probléma.
- 2025-06-04 · AI Trends 2025: Mary Meeker Deck Deep Dive Part 1 — 41 perces részletes elemzés.
- 2025-06-05 · Deep Dive on OpenAI Data Connectors — Gmail/Calendar/Drive connector-tesztelés, 15-cap-finding.
- 2025-06-06 · Scaling isn’t Destiny — kontra-tézis a “csak pre-train + inference == AGI”-egyenleten.
Primer forrás — Anthropic hivatalos:
- 2025-06-04 · A Conversation on Claude Code — Boris (Claude Code creator) + Alex (Claude relations) — dogfooding, 4-es modellek, GitHub Actions, plan-first habit, CLAUDE.md hierarchia.
Körbejárás / tech-mélység — Latent Space podcast:
- 2025-06-02 · AIEWF Preview — Gemini in 2025 and Realtime Voice AI — Logan Kilpatrick (Google) + Quinn Wildman (Daily/Pipecat) — Live API, voice-AI-latency.
- 2025-06-03 · AIEWF Preview — Containing Agent Chaos — Solomon Hykes — Docker-alkotó az agent-environment-szabvány hiányáról.
- 2025-06-06 · The Utility of Interpretability — Emmanuel Amiesen — Anthropic-fellow + circuit-tracing release demo.
Peter Yang (@petergyang) — gyakorlati hands-on:
- 2025-06-04 · ChatGPT vs Claude vs Gemini: The Best AI for Each Use Case in 2025 — head-to-head Tetris, Solar System, Mario coding-teszt; Claude winsz coding/írás, ChatGPT memory + research, Gemini cost + video.
Fact-check és hivatkozott eredeti források:
- BOND Capital — Trends: Artificial Intelligence (Mary Meeker, 340 slide, 2025-05-30)
- Anthropic — Open-sourcing circuit-tracing tools (2025-05-29)
- Neuronpedia — interaktív attribúciós-gráf-felület
- OpenAI — More ways to work with your team and tools in ChatGPT (data connectors, 2025-06-04)
- TechCrunch — ChatGPT introduces meeting recording and connectors (2025-06-04)
- Latent Space — AI Engineering Goes Mainstream (AIEWF 2025 keynote-recap, container-use bejelentés)
- GitHub — anthropics/claude-code-action
A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.