Heti AI-hírlevél · ITLine

2025-W23   2025-06-02 — 2025-06-08   ·   14 forrás

W23 — Konténerek az agenteknek, attribúciós gráfok az LLM-belekben, és Mary Meeker 340 oldala

Solomon Hykes (Docker) megnyitja a Daggert AI-agentekhez — konténer és isolation a kódoló agenteknek. Anthropic open-source-olja az attribúciós-gráf interpretability eszközt Gemma és Llama modellekre. Mary Meeker BOND-deck (340 slide) AI-trend-térképe. OpenAI data connectors gyenge first release-ben, Claude Code GitHub Actions-be költözik.

Kép helye — Bal oldalt egy fejlesztő több párhuzamos terminál-ablakot néz, mindegyikben egy ‘claude’ agent dolgozik egy izolált konténerben — felirat: ‘container-use’. Jobb oldalt egy semantically circuit-szerű gráf egy LLM internal state-jéről, kis dobozokkal: ‘Texas’, ‘Austin’, ‘Dallas’ — felirat: ‘attribution graph’.

A hét három, egymástól függetlennek tűnő mozdulata ugyanazt a mérnöki problémát feszegeti: hogyan lesz az LLM-alapú agent bevizsgálható, korlátozható és skálázható — vagyis production-grade. Egy: Solomon Hykes (Docker megalkotója) az AI Engineer World’s Fair-en bejelenti a Dagger container-use projektet, és a Latent Space-féle előzetes interjúban elmagyarázza, miért érzi ezt a Docker óta a legnagyobb ötletének: a kódoló agenteknek dedikált, izolált, hordozható környezet kell, és a jelenlegi IDE-monolit-megoldások fragmentálnak, nem standardizálnak. Kettő: Anthropic publikálja az “open-source circuit tracing” eszközt, és Emmanuel Amiesen a Latent Space podcastjában részletesen bemutatja, hogyan lehet Gemma-2-2b és Llama-3.2-1b modelleken attribúciós gráfot generálni egyetlen prompton — vagyis az LLM belső döntéseit lépésről lépésre felépítő-réteget kapunk. Három: Mary Meeker (volt “queen of the internet”) öt év csend után 340 oldalas AI-trend deckkel jön, és Nate egy hosszú elemzéssel emeli ki a fő tanulságot: B2B-ben sok nyertes lesz, B2C-ben már eldőlt. Plusz: Anthropic nyilvánosan beszél a Claude Code-ról, az OpenAI elsiet a data-connector launchcsel, és Nate egy fontos kontra-tézist tesz le az “AGI-egyenes vonal” mítosz ellen.

Solomon Hykes és a “container-use for agents”

A június 3-i Latent Space-előzetesében Hykes egy egyszerű, de fontos megfigyelést tesz: a fejlesztők platform-mérnökökké válnak, amikor coding agentet futtatnak. “Increasingly, your job is not going to be to actually develop, but to manage and enable these coding agents.” Egy agent egy laptopon még működik, de több agent párhuzamosan ugyanazon a kódbázison azonnal kollíziót okoz — file-system konfliktusok, kéretlen tool-hívások, állapot-szennyezés. A jelenlegi gyakorlat (git worktrees, ad-hoc Docker-alkalmazás) duct-tape-megoldás.

A javaslata: a környezet legyen a stack első osztályú összetevője, ne az IDE alá rejtett implementáció-részlet. Konkrét kritériumok, amiket Hykes megfogalmaz:

A hetekkel későbbi AI Engineer World’s Fair keynote-on Hykes élőben open-source-olja a container-use projektet, és a színpadon hat Claude Code instance-t plus egy Goose-t futtat párhuzamosan — mindegyik külön izolált konténerben dolgozik ugyanazon a webprojekten, és a fejlesztő merge-eli, amelyik tetszik. Ez a minta a multi-agent SET-tézis közvetlen iparági párja: nem az LLM-cégek mondanak újat, hanem a Docker-alkotó hozza el azt a réteget, ami eddig hiányzott — az isolation- és environment-réteget agentekhez. Hykes precízen fogalmaz: “we’ve got a bunch of standards to work with — container tech, git, the OpenAI API spec, MCP. That’s a pretty good set of standards. But yeah, it’s got to be a new UX.”

A párhuzam Docker-rel önreflexív: a 2013-as Dockerfile is “stop-gap prototype thinking, oh, we’ll clean this up later” volt — aztán befagyott a használati nyomás miatt. Hykes most második esélyt kap: a környezet-szabvány újratervezésére agent-natív kontextusban. Az ITLine / SET-szempontból ez stratégiai jelzés — az orchestration-réteg most még nyitott szabvány-mezőn áll, és aki most épít, elkapja a komponens-szintű best practice-t, mielőtt befagy.

Anthropic — interpretability, ami először használható

Az Anthropic május 29-én publikálja a “circuit tracing” open-source release-t, és a június 6-i Latent Space-en Emmanuel Amiesen részletesen demózza. Mit lehet csinálni vele? Megmutatja, mi történik a modell belsejében egy adott prompt + adott token-output között: melyik feature-réteg aktiválódott, melyik volt oksági szempontból fontos, melyiket lehetett kikapcsolni anélkül, hogy a kimenet változott volna.

A nyilvános felület a Neuronpedia — Gemma-2-2b és Llama-3.2-1b modellekre, ingyen, Google Colab-on is futtatható. A használati keret meglepően könnyed: prompt-megadás, “next word” cél-token kijelölése, generálás, kattintható gráf-felület. Amiesen demója: a “the capital of the state where Dallas is is…” multi-hop reasoning azonos mintát mutat Gemma-ban, mint a Claude-ban — azaz a két különböző modell ugyanazt a köztes Texas-feature-t járja be Austin előtt, ami önmagában is kutatási eredmény.

A SET / orchestration-szempontból három dolog érdekes:

  1. Vibes-eval helyett oksági teszt. Eddig egy LLM-failure-t leginkább “javítgatni” tudtunk újabb prompttal, fine-tuninggal, példák cserélésével. A circuit-tracing direkt megmutatja, mi nem stimmelt — pl. ha egy spec-aware agent rosszul azonosít egy jogszabály-kontextust, megnézhetjük, melyik feature-rétegek aktiválódtak hibásan. Ezt Vivu (a Latent Space vendég-co-host) közvetlenül megfogalmazza: “we have pretty straightforward evals for math and code. But we don’t have vibes-based heuristic evals… can we trace through how it gives responses?”
  2. Base vs chat-modell diff. Amiesen javasolja: ugyanazt a circuit-traceolást futtassuk egy base-Gemma-n és egy fine-tuned chat-Gemma-n, és nézzük a különbséget — vagyis: mit “tanult” a modell az RLHF-fázisban. Ez egy konkrét audit-eszköz olyan enterprise-deploymenthez, ahol egy custom fine-tune jön egy base-modell tetejére.
  3. A teljes tooling Cloud Code-natívan használható. Amiesen elismerően említi: a Latent Space podcaster lényegében “cloned the repo, threw it into Claude Code, and was like ‘deal with this, let’s try it end-to-end’” — és működött. Ez a “tools that an agent can pick up by itself” minta most már kutatási tooling-szinten is realitás.

Az interpretability 5 évig kutatási hobby volt a frontier-laboknál; ez az első release, ami egy átlagos enterprise-csapat is használhat anélkül, hogy ML-kutató-háttér kellene hozzá.

Mary Meeker (BOND Capital, ex-Kleiner Perkins, “Internet Trends” sorozat 1995–2019) május 30-án publikálja az első Trends-jelentését 5 év szünet után — és teljes egészében az AI-ról. 340 dia. Nate két egész videót szentel az elemzésnek a héten.

A számok, amik megérik a fact-checket:

Nate három kontra-pontját érdemes hozzátenni:

  1. B2C-ben már eldőlt, B2B-ben sok nyertes. Mary klasszikus közgazdász-keretben gondolja a versenyt (“good for consumers”); Nate empirikusan azt látja, hogy a fogyasztók már beleilleszkedtek a ChatGPT habit-stack-be, és nem cserélgetnek. B2B-ben viszont a use-case-fragmentáció miatt sok kis nyertes lehet — itt lényeges az alacsony token-cost.
  2. A “messy middle” mid-marketben senkié. Nagy cégek be tudnak építeni LLM-engineering-csapatot; kis cégek pre-built agentet használnak. A közepes cégek viszont custom igényűek, de nincs $300k/év AI-engineer-budget-jük — és erre a sávra ma nincs jó válasz. (ITLine-szempontból ez direkt értékesítési mező: a “developer-szintű oktatás + külső orchestration” kínálat pont ide cél, lásd docs/sales/positioning.md.)
  3. A capital-overhang nem fenntartható. “You’ve got something you are selling that’s depreciating really fast — that’s tokens. And it costs a lot to make a new model. I don’t know how you clear money on that long term.” Nate Uber-analógiája: az olcsó-token-fázis ugyanúgy véget ér majd, mint a $2-es Uber-fázis.

OpenAI data connectors — a stratégia jó, a release sietős

Az OpenAI június 4-én publikálja a ChatGPT data connectors-t — Gmail, Google Calendar, Drive, SharePoint, Outlook, Box, Dropbox, GitHub, Linear, HubSpot, Teams. Nate másnapi részletes review-jában precízen körüljárja, miért stratégiailag jó, használati szempontból viszont gyenge ez a release.

A működési diagnózis: az API-réteg, amit a Deep Research a connector-ekhez használ, felül 15-en cap-pol. “If you want to do a comprehensive analysis of last month’s email volume — it can’t do that. It has access, but because of the thinness of the data pipe it’s working with, it is absolutely impossible.” Nate konkrét kísérletei: 100 email cohort-elemzése — a kategóriákat eltalálja, a számokat hibásan tippeli (kézzel ellenőrizve). 100 calendar-doc-elemzés — bizonyíthatóan csak 3-at tud meghívni. Vagyis: a connector bekötve van, de a pipe szűk, és a Deep Research-szintű reasoning a rendelkezésre álló mintán futtatódik.

Ahol jól működik: specifikus, keyword-által pontosan körülhatárolt query (pl. “adj briefinget XYZ webinarról az emailem, naptáram és a nyilt web alapján”). Itt a 15-os cap is elég, mert eseményenként kevés rekord van, és ezeket szépen összetudja olvasni.

A három tanulság:

  1. A stratégia transzparens. OpenAI az “OS for the enterprise” víziót követi. Aki vállalati workflow-be akar AI-t, annak kötelezően Gmail-, Calendar-, SharePoint-, Outlook-integrációja van — az OpenAI nem hagyja ki.
  2. Ez egy training-data-háború is. “Everybody’s hungry for it. They’re building connections to Gmail for training data, for calendar for training data, anything they can get.” Ez magyarázza az Anthropic-Windsurf-elszakítást is: a Windsurf-tokenek nem az OpenAI-é lehettek, mert tanítani lehet rajta.
  3. Az operator-precedens. Nate emlékeztet: a januári Operator launch is gyenge volt, április-májusra azonban 03-modellel 10x jobb lett. Várhatóan a connector-pipe is kibővül 6 hónapon belül.

A SET-tanulság: ne építsd be a mai cap-okat a workflow-ba. Ha az enterprise-stacked connector-cap-tól függ, az 6 hónap alatt elavul.

Mellékszál — Claude Code az Anthropic saját szemszögéből

Az Anthropic június 4-i podcastjában Boris (a Claude Code megalkotója) beszélget Alex-szel (Claude relations). Pár, nem hype-os mérnöki megfigyelés:

Mellékszál — Gemini Live API + a Voice-AI-stack érettsége

A június 2-i Latent Space-Twiml közös I/O-podcastben Logan Kilpatrick + Shrestha Basu Mallick (Google AI Studio, Live API), Quinn Wildman (Daily / Pipecat) beszélnek. Két érdekes pont:

Ha hangos AI-t terveznek, az ekkora real-time latency-budget és a VAD-tuning alapfeltétel; nem az LLM intelligenciája lesz a szűk keresztmetszet, hanem a tool-orchestration.

Mellékszál — “Scaling isn’t Destiny”

Nate egy fontos kontra-tézist tesz le az “AGI-egyenes-vonal” optimizmussal szemben: a pre-training + inference önmagában nem elég ahhoz, amit a CEO-k ígérnek. Nate négy hiányzó képességet sorol:

  1. Adaptív kontextus. Olyan helyzet, ahol egyszerre 2-3 dimenzió változik (sales-target, product, finance, customer-success), és emberek könnyen követik. AI ma még nem.
  2. Intent over time. Hetes-hónapos cél tartása aktív kalibrációval.
  3. Tacit knowledge. Társadalmi költséggel járó, ezért soha le nem írt munkahelyi tudás. AI nem látja.
  4. Multi-reward optimalizálás. Marketing, ahol nem egy clear-pass/fail metric van, hanem több részleges jutalom + késleltetett feedback.

Ez egy józan és bátor kontra-pont a hét másik üzenetére: a connector-háború + capex-robbanás közben nem oldottuk meg a tényleges enterprise-blokkolókat. Nate elhelyezi a “jagged AGI” fogalmat: lehet, hogy egyes képességek beérkeznek (kódolás, code-review), míg mások (ügyfélkezelés, stratégiai tervezés) évtizedekig hátramaradnak.

Mit viszünk magunkkal

Három mérnöki / SET-fókuszú kérdés, amit a hét felvet:

  1. Az “agent environment” mint külön réteg a stackünkben. Ha többszörös, párhuzamos coding agent-tel dolgozunk (vagy tervezünk), érdemes Hykes kritérium-listáját átfutni: izoláció, hordozhatóság, megfigyelhetőség, multiplayer, lokális futás. A git worktrees + Docker-via-Claude-Code minta átmeneti megoldás; aki most rögzít szabványt egy belső projektben, 6-12 hónap múlva előnyben lesz, mert az iparági szabványalakulás még zajlik.
  2. Verifier-réteg attribution-graph-támogatással. A SET-tézis (W07, Anthropic Building Effective Agents) szerint a verifier-réteg a stack alapja. Az új interpretability-tooling — Gemma/Llama szinten ma, később remélhetőleg nagyobb modelleken — direkt eszköz arra, hogy LLM-failure-eknél nem csak “fix-et próbáljunk”, hanem visszamenőleg lássuk az oksági sort. Érdemes kísérleti audit-checklistába felvenni: ha egy fine-tuned agent rosszul reagál, mielőtt új prompttal próbálkoznánk, futtassunk attribúciós-gráfot a base- és fine-tuned variancán, és nézzük a különbséget.
  3. A “B2B-mid-market” pozícionálás megerősítése. Mary Meeker (és Nate kontra-pontja) együtt megerősíti az ITLine-tézist: B2C-ben elveszett a piac, de B2B-ben — különösen a mid-marketben — a custom-igények és a hiányzó saját AI-engineer kapacitás miatt strukturális kereslet van olyan partnerre, aki fel tud építeni egy verifier-eset, on-prem orchestration-réteget, és megtanítja a fejlesztőcsapatot karbantartani. A két-sávos (on-prem / cloud) Astron-üzenet (lásd MEMORY.md) most a Mary-féle számokkal is alátámasztva.

A W24-ben a teljes AI Engineer World’s Fair (június 3-5) keynote-jainak utórezgései jönnek — Hykes container-use launch, plus Anthropic, OpenAI, Google session-jei.

Források

Fő forrás — Nate B Jones csatornája:

Primer forrás — Anthropic hivatalos:

Körbejárás / tech-mélység — Latent Space podcast:

Peter Yang (@petergyang) — gyakorlati hands-on:

Fact-check és hivatkozott eredeti források:


A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.