Heti AI-hírlevél · ITLine

2025-W07   2025-02-10 — 2025-02-16   ·   8 forrás

W07 — A Frontier-modellek egyesülnek, és az Anthropic kiadja az agent-építés alapszabályait

Sam Altman a GPT-5 roadmapben kimondja: ‘utáljuk a modell-választót’, GPT-4.5 (Orion) az utolsó nem-érvelő modell, GPT-5 mindent egybepakol. Az Anthropic publikálja a ‘Building Effective Agents’ részletes útmutatót — workflow vs agent, verifikálhatóság, ‘be empathetic to the model’. Közben Meta humanoid robotokat épít, Bret Taylor (Sierra) az AI-architektúráról beszél.

Kép helye — Két oldal: bal oldalt egy egyszerű ‘GPT-5’ címke felülír egy modell-listát (4o, o1, o3-mini, o3-mini-high…), jobb oldalt egy workflow-graph és egy agent-loop diagrammája — ‘workflow vs agent’

A hét két oldalról is tisztul. Egyfelől Sam Altman február 12-én X-en publikálja az OpenAI roadmapjét: GPT-4.5 (kódnéven Orion) az utolsó hagyományos, nem-érvelő modell, és néhány héten belül érkezik. A GPT-5 viszont egy egyesített rendszer, ami az o-sorozatot, a chat-modelleket, az érvelést, az agent-funkciót és minden eszközt egybeolvaszt — Altman fogalmazása: “we hate the model picker as much as you do”. Másfelől az Anthropic publikálja a Building Effective Agents részletes útmutatót, és a héten külön videót is kiad hozzá — Erik, Barry és Alex (kutatás, applied AI, Claude relations) konkrét, tesztelt definíciókat ad workflow-ra és agent-re, és kimondja a sweet spot határait. A két irány közös szála: az “agent” mint szerteágazó marketing-fogalom kategóriává érlelődik, mind termékoldalon (egyesített Frontier-modell), mind mérnöki oldalon (formalizált best practice). Plus a héten Meta humanoid robotokat építi, Bret Taylor (Sierra, ex-Salesforce-CEO) interjúzik a Latent Space-en az AI-architektúráról, és a Claude 4 launch-rumor megerősödik.

Az OpenAI a “model picker”-t felmondja

Altman február 12-i X-posztjának három fontos állítása van. Egy: GPT-4.5 (Orion kódnéven, ami már 2024 ősz óta szivárgott) az utolsó “hagyományos” modell — nem-érvelő, nem use inference-time compute-ot, gyors válaszokat ad. Hetek a kiadásig. Kettő: GPT-5 nem egy újabb pre-train-modell, hanem egy egyesített rendszer, ami a GPT-szériát, az o-szériát, a Deep Research-et, az Operator-t és minden új eszközt egy felület mögé pakol. A GPT-5 maga dönti el, hogy egy adott query-re fast-response vagy deep-reasoning kell. Három: a free tier korlátlan GPT-5 chat-hozzáférést kap, a Plus és Pro tier-ek pedig magasabb reasoning-szinten kapják.

Nate a február 12-i videójában a model-osztályozás strukturális zavarát emeli ki. Mostanra három osztály létezik, és a sajtó és a felhasználók ezeket egybekeverik:

  1. Fast-response: GPT-4o, Claude Sonnet — másodperces válasz, szöveg-generálás
  2. Light reasoning (60 sec alatt): Gemini Flash Thinking, DeepSeek R1, o3-mini
  3. Deep reasoning (perceket gondolkodik): o1 Pro, Deep Research

A 3. osztály tényleg minőségileg más — Nate szerint aki nem használt o1 Pro-t vagy Deep Research-et, nem érti, miért foglalkoznak a Frontier Lab-ek inference-time compute-tal. Az egyesítés tervezésileg azt jelenti, hogy a felhasználónak már nem kell kiválasztania — a modell látja a query nehézségét és magától választ. Ez UX-szempontból nagy változás, de architektúra-szempontból is: az LLM-ek mostantól nem egy-egy különálló entitás, hanem egy routing-réteg + több backend-modell.

A február 13-i második Nate-videó ezt egy stratégiai keretbe helyezi: a DeepSeek megnyerte a háborút (a piac szabályait átírta), de elvesztette a játékot. A DeepSeek a transzparens reasoning + ingyenes hozzáférés mintáját bevezette; az OpenAI hetek alatt lemásolta (Chain-of-Thought exposed, Deep Research később free-tier-en is — bár a tényleges Plus-rollout február 25-én jött, free-tier még később). A SoftBank várható $40 milliárd dolláros befektetése lehetővé teszi, hogy az OpenAI agresszíven ingyen ossza, amit a DeepSeek pénzért adna. A Challenger megváltoztatta a játékot, a domináns játékos átveszi az új szabályokat és nyer.

Anthropic — a “Building Effective Agents” kiadás kontextusban

Az Anthropic a Building Effective Agents blogposztot eredetileg 2024 decemberében publikálta, de a héten részletes mérnöki videó-megbeszélést ad ki hozzá. A három beszélgetőpartner: Erik (research), Barry (applied AI), Alex (Claude relations). Pár konkrét megállapítás, ami közvetlenül hasznos egy enterprise-stack tervezésnél:

A workflow és az agent két különböző dolog. A workflow: előre rögzített kód-orchestration, fix számú LLM-hívás, ismert lépés-szekvencia. Az agent: az LLM dönti el, hány lépés és milyen sorrendben — autonóm loop, addig fut, amíg a probléma megoldódik vagy a verifier elfogadja. Mindkettő része az “agentic systems” tágabb kategóriájának, de a tervezésnél nem ugyanaz: az agent rugalmasabb, drágább, kevésbé predikció.

A sweet spot a verifikálhatóság. Erik szerint a kódolás az ideális agent-feladat, mert a kimenetet tesztekkel lehet ellenőrizni — minden iterációban a verifier visszajelzést ad, és a modell konvergálhat. “There’s no equivalent way to do that for many other fields” — sok területen nincs olcsó verifier, és ez korlátozza, hol érdemes agent-et használni. A 2025-ös frontvonal: olyan területeken keresni, ahol verifier-réteg kiépíthető vagy már létezik (data-pipeline correctness, security-scan, dokumentum-konformitás, smoke-test). Ez direkten egybecseng a SET-tézissel: a külső verifier-réteg nélkül az agent-output megbízhatatlan.

“Be empathetic to the model.” Barry konkrét anekdotája: amikor egy computer-use benchmark-on (OS World) furcsa agent-trajectory-kat látott, a csapata szó szerint becsukta a szemét egy percre, majd egy másodpercig pislantott, és úgy próbálta python-kódolni a feladatot — hogy átérezzék, mit lát az agent. A tanulság: a tool-leírás minősége egy szintű a prompt-minőséggel. Sok fejlesztő gyönyörű promptot ír, de a tool-okat “named A and B” paraméterekkel adja át — a modell nem fogja jól használni. A SET / orchestration-szempont: a tool-szerződés (signature, dokumentáció, error-message) a stack része, nem mellékterv.

Multi-agent még nincs production-ban. Barry kimondja: “in production we haven’t even seen a lot of successful single agents”. A multi-agent-environment érdekes kutatási irány (ő például egy “werewolf”-játszmát épített Claude-példányokkal), de 2025-ben még a stabil single-agent működés az iparági feladat. Ez egy fontos visszahúzás a sok hype-reklámmal szemben.

Záró tanács. Erik: “if the models get smarter, your moat disappears, you’re building the wrong thing”. Vagyis: az enterprise-stack úgy épüljön, hogy a modell javulása fokozza a terméket, ne aláássa. Konkrétan: ne kódold be a modell aktuális hibáit a workflow-ba; tervezd úgy, hogy egy okosabb modell jobban működjön. Ez a SET-megközelítés direkt fordítása: a verifikáció és gate-ek modell-független rétegben élnek.

A Latent Space — Bret Taylor és a smol agents

A február 11-i Latent Space epizód Bret Taylor-t hozza el — Sierra (AI-customer-service-agent-startup) CEO-ja, ex-Salesforce CEO, ex-Twitter board chair. Taylor központi tézise: az enterprise-AI-fejlesztés mintázata átkerül a “modell-fejlesztés” fókuszáról a “fejlett architektúra” fókuszára. A Sierra például több cégspecifikus agent-et csinál — ahelyett, hogy egy mindentudót próbálna —, és minden agent saját kontextus-csomaggal, saját tool-szerződéssel, saját verifier-rel működik. Ez architektúra-mintaként sokkal közelebb áll a klasszikus mikroszerviz-szervezéshez, mint a “kérdezz egy LLM-et” mintához.

A február 13-i második Latent Space epizód — “Smol Agents are All You Need” — egy Hugging Face-féle minimalista agent-framework-ről szól. Az érvelés: a kommerszben kínált agent-frameworkök (LangChain, LangGraph) túltervezettek — a többségéhez kevesebb mint 100 sor python kód elegendő. Ez vágja a Pydantic-Colvin-tézis W06-os érvelését is: az agent-framework önmagában nem komplex tervezési probléma, az igazi munka a tool-szerződésekben és a verifier-rétegben van.

A két Latent Space-epizód együtt erős narratíva: az agent-stack mérnöki érettsége nem egyetlen big-framework-választás, hanem mérnöki minőségű komponens-építés.

Apróbb hírek a hétről

Mit viszünk magunkkal

A hét három mérnöki / IT-vezetői kérdést hagy ott:

  1. Az “agent” definíció tisztázása belső dokumentációban. Ha a csapatod használja az “agent” szót, érdemes átvenni az Anthropic-féle különbségtételt: workflow = előre orchestrated, agent = LLM-vezérelt loop. Sok belső “agent-projekt” valójában workflow, és ez nem hiba — sok feladatra a workflow a megfelelő mintázat, csak hívjuk a nevén. A terminológia tisztasága a tervezési minőséget javítja.
  2. Verifier-réteg-strategy. A SET-tézist most az Anthropic primer forrása is megerősíti: a sweet spot ott van, ahol olcsó verifier (teszt, ellenőrző-szabály, szabványellenőrzés) elérhető. Ha új AI-feladatot tervezel, a verifier-tervezést tedd elsőre, ne a modell-választást. “Without a feedback loop, you don’t converge — you just get noise” (Erik, Anthropic videó).
  3. A “model getting smarter” stress-test. Erik kérdése — “if the models get smarter, does your product get better or worse?” — egy konkrét architektúra-review-séma. Saját stack-en érdemes megnézni: mely komponensek profitálnak egy okosabb modellből (verifier-szabályok, audit-log, tool-szerződések), és mely komponensek veszítenek (workaround-prompt-ok, modell-specifikus parsing, hibatűrő-kódolás). Ami veszít, az technical debt, és érdemes refaktorra ütemezni.

A W08-ban Anthropic Claude 3.7 Sonnet várható, és a Grok-3 első benchmark-eredményei.

Források

Fő forrás — Nate B Jones csatornája:

Primer forrás — Anthropic hivatalos:

Körbejárás / tech-mélység — Latent Space podcast:

Fact-check és hivatkozott eredeti források:


A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.