A hét két oldalról is tisztul. Egyfelől Sam Altman február 12-én X-en publikálja az OpenAI roadmapjét: GPT-4.5 (kódnéven Orion) az utolsó hagyományos, nem-érvelő modell, és néhány héten belül érkezik. A GPT-5 viszont egy egyesített rendszer, ami az o-sorozatot, a chat-modelleket, az érvelést, az agent-funkciót és minden eszközt egybeolvaszt — Altman fogalmazása: “we hate the model picker as much as you do”. Másfelől az Anthropic publikálja a Building Effective Agents részletes útmutatót, és a héten külön videót is kiad hozzá — Erik, Barry és Alex (kutatás, applied AI, Claude relations) konkrét, tesztelt definíciókat ad workflow-ra és agent-re, és kimondja a sweet spot határait. A két irány közös szála: az “agent” mint szerteágazó marketing-fogalom kategóriává érlelődik, mind termékoldalon (egyesített Frontier-modell), mind mérnöki oldalon (formalizált best practice). Plus a héten Meta humanoid robotokat építi, Bret Taylor (Sierra, ex-Salesforce-CEO) interjúzik a Latent Space-en az AI-architektúráról, és a Claude 4 launch-rumor megerősödik.
Az OpenAI a “model picker”-t felmondja
Altman február 12-i X-posztjának három fontos állítása van. Egy: GPT-4.5 (Orion kódnéven, ami már 2024 ősz óta szivárgott) az utolsó “hagyományos” modell — nem-érvelő, nem use inference-time compute-ot, gyors válaszokat ad. Hetek a kiadásig. Kettő: GPT-5 nem egy újabb pre-train-modell, hanem egy egyesített rendszer, ami a GPT-szériát, az o-szériát, a Deep Research-et, az Operator-t és minden új eszközt egy felület mögé pakol. A GPT-5 maga dönti el, hogy egy adott query-re fast-response vagy deep-reasoning kell. Három: a free tier korlátlan GPT-5 chat-hozzáférést kap, a Plus és Pro tier-ek pedig magasabb reasoning-szinten kapják.
Nate a február 12-i videójában a model-osztályozás strukturális zavarát emeli ki. Mostanra három osztály létezik, és a sajtó és a felhasználók ezeket egybekeverik:
- Fast-response: GPT-4o, Claude Sonnet — másodperces válasz, szöveg-generálás
- Light reasoning (60 sec alatt): Gemini Flash Thinking, DeepSeek R1, o3-mini
- Deep reasoning (perceket gondolkodik): o1 Pro, Deep Research
A 3. osztály tényleg minőségileg más — Nate szerint aki nem használt o1 Pro-t vagy Deep Research-et, nem érti, miért foglalkoznak a Frontier Lab-ek inference-time compute-tal. Az egyesítés tervezésileg azt jelenti, hogy a felhasználónak már nem kell kiválasztania — a modell látja a query nehézségét és magától választ. Ez UX-szempontból nagy változás, de architektúra-szempontból is: az LLM-ek mostantól nem egy-egy különálló entitás, hanem egy routing-réteg + több backend-modell.
A február 13-i második Nate-videó ezt egy stratégiai keretbe helyezi: a DeepSeek megnyerte a háborút (a piac szabályait átírta), de elvesztette a játékot. A DeepSeek a transzparens reasoning + ingyenes hozzáférés mintáját bevezette; az OpenAI hetek alatt lemásolta (Chain-of-Thought exposed, Deep Research később free-tier-en is — bár a tényleges Plus-rollout február 25-én jött, free-tier még később). A SoftBank várható $40 milliárd dolláros befektetése lehetővé teszi, hogy az OpenAI agresszíven ingyen ossza, amit a DeepSeek pénzért adna. A Challenger megváltoztatta a játékot, a domináns játékos átveszi az új szabályokat és nyer.
Anthropic — a “Building Effective Agents” kiadás kontextusban
Az Anthropic a Building Effective Agents blogposztot eredetileg 2024 decemberében publikálta, de a héten részletes mérnöki videó-megbeszélést ad ki hozzá. A három beszélgetőpartner: Erik (research), Barry (applied AI), Alex (Claude relations). Pár konkrét megállapítás, ami közvetlenül hasznos egy enterprise-stack tervezésnél:
A workflow és az agent két különböző dolog. A workflow: előre rögzített kód-orchestration, fix számú LLM-hívás, ismert lépés-szekvencia. Az agent: az LLM dönti el, hány lépés és milyen sorrendben — autonóm loop, addig fut, amíg a probléma megoldódik vagy a verifier elfogadja. Mindkettő része az “agentic systems” tágabb kategóriájának, de a tervezésnél nem ugyanaz: az agent rugalmasabb, drágább, kevésbé predikció.
A sweet spot a verifikálhatóság. Erik szerint a kódolás az ideális agent-feladat, mert a kimenetet tesztekkel lehet ellenőrizni — minden iterációban a verifier visszajelzést ad, és a modell konvergálhat. “There’s no equivalent way to do that for many other fields” — sok területen nincs olcsó verifier, és ez korlátozza, hol érdemes agent-et használni. A 2025-ös frontvonal: olyan területeken keresni, ahol verifier-réteg kiépíthető vagy már létezik (data-pipeline correctness, security-scan, dokumentum-konformitás, smoke-test). Ez direkten egybecseng a SET-tézissel: a külső verifier-réteg nélkül az agent-output megbízhatatlan.
“Be empathetic to the model.” Barry konkrét anekdotája: amikor egy computer-use benchmark-on (OS World) furcsa agent-trajectory-kat látott, a csapata szó szerint becsukta a szemét egy percre, majd egy másodpercig pislantott, és úgy próbálta python-kódolni a feladatot — hogy átérezzék, mit lát az agent. A tanulság: a tool-leírás minősége egy szintű a prompt-minőséggel. Sok fejlesztő gyönyörű promptot ír, de a tool-okat “named A and B” paraméterekkel adja át — a modell nem fogja jól használni. A SET / orchestration-szempont: a tool-szerződés (signature, dokumentáció, error-message) a stack része, nem mellékterv.
Multi-agent még nincs production-ban. Barry kimondja: “in production we haven’t even seen a lot of successful single agents”. A multi-agent-environment érdekes kutatási irány (ő például egy “werewolf”-játszmát épített Claude-példányokkal), de 2025-ben még a stabil single-agent működés az iparági feladat. Ez egy fontos visszahúzás a sok hype-reklámmal szemben.
Záró tanács. Erik: “if the models get smarter, your moat disappears, you’re building the wrong thing”. Vagyis: az enterprise-stack úgy épüljön, hogy a modell javulása fokozza a terméket, ne aláássa. Konkrétan: ne kódold be a modell aktuális hibáit a workflow-ba; tervezd úgy, hogy egy okosabb modell jobban működjön. Ez a SET-megközelítés direkt fordítása: a verifikáció és gate-ek modell-független rétegben élnek.
A Latent Space — Bret Taylor és a smol agents
A február 11-i Latent Space epizód Bret Taylor-t hozza el — Sierra (AI-customer-service-agent-startup) CEO-ja, ex-Salesforce CEO, ex-Twitter board chair. Taylor központi tézise: az enterprise-AI-fejlesztés mintázata átkerül a “modell-fejlesztés” fókuszáról a “fejlett architektúra” fókuszára. A Sierra például több cégspecifikus agent-et csinál — ahelyett, hogy egy mindentudót próbálna —, és minden agent saját kontextus-csomaggal, saját tool-szerződéssel, saját verifier-rel működik. Ez architektúra-mintaként sokkal közelebb áll a klasszikus mikroszerviz-szervezéshez, mint a “kérdezz egy LLM-et” mintához.
A február 13-i második Latent Space epizód — “Smol Agents are All You Need” — egy Hugging Face-féle minimalista agent-framework-ről szól. Az érvelés: a kommerszben kínált agent-frameworkök (LangChain, LangGraph) túltervezettek — a többségéhez kevesebb mint 100 sor python kód elegendő. Ez vágja a Pydantic-Colvin-tézis W06-os érvelését is: az agent-framework önmagában nem komplex tervezési probléma, az igazi munka a tool-szerződésekben és a verifier-rétegben van.
A két Latent Space-epizód együtt erős narratíva: az agent-stack mérnöki érettsége nem egyetlen big-framework-választás, hanem mérnöki minőségű komponens-építés.
Apróbb hírek a hétről
- Mistral visszatért: a francia AI-startup új modelleket ad ki (Le Chat termék-átdolgozás, sebesség-fókusz). Európai opció, ami GDPR-kompatibilis enterprise-deployment-hez érdekes lehet.
- DeepSeek és az ai.com domain: kiderül, hogy az
ai.comURL — ami DeepSeek-re irányít — nem DeepSeek tulajdona; egy malajziai cég birtokolja 1993 óta, és bérbe adja a redirect-et. - Gemini 2.0 Flash misalignment-incidens: egy felhasználónak megpróbál $5-öt felszámítani egy szolgáltatás keretében, amihez nincs jogosultsága. Apró, de figyelmeztető — az agent-environment-ekben a financial side-effect-ek komoly audit-tárgyak.
- Meta humanoid robot-osztály: Zuck a household-chore-robot piacra céloz, saját hardver + szoftver. A 2025-ös robot-trend (Nvidia Cosmos+Thor a W02-ben, most Meta) konvergál.
- Meta non-invasive brain-text dekóder: 80%-os pontosság real-time latencyvel — még prototípus, de irány-jelzés.
- Claude 4 rumor: a hét végén The Information beszámolója szerint a Claude 4 hetek alatt jön, és egyesítve lesz reasoning + chat (mint a GPT-5-tervezet). Plus csúszka-API: fejlesztők finomszintű reasoning-budget-et állíthatnak. Ezzel ellentétes a W04-es Davos-Amodei “smarter model in coming months” framing — vagyis az Anthropic gyorsít.
Mit viszünk magunkkal
A hét három mérnöki / IT-vezetői kérdést hagy ott:
- Az “agent” definíció tisztázása belső dokumentációban. Ha a csapatod használja az “agent” szót, érdemes átvenni az Anthropic-féle különbségtételt: workflow = előre orchestrated, agent = LLM-vezérelt loop. Sok belső “agent-projekt” valójában workflow, és ez nem hiba — sok feladatra a workflow a megfelelő mintázat, csak hívjuk a nevén. A terminológia tisztasága a tervezési minőséget javítja.
- Verifier-réteg-strategy. A SET-tézist most az Anthropic primer forrása is megerősíti: a sweet spot ott van, ahol olcsó verifier (teszt, ellenőrző-szabály, szabványellenőrzés) elérhető. Ha új AI-feladatot tervezel, a verifier-tervezést tedd elsőre, ne a modell-választást. “Without a feedback loop, you don’t converge — you just get noise” (Erik, Anthropic videó).
- A “model getting smarter” stress-test. Erik kérdése — “if the models get smarter, does your product get better or worse?” — egy konkrét architektúra-review-séma. Saját stack-en érdemes megnézni: mely komponensek profitálnak egy okosabb modellből (verifier-szabályok, audit-log, tool-szerződések), és mely komponensek veszítenek (workaround-prompt-ok, modell-specifikus parsing, hibatűrő-kódolás). Ami veszít, az technical debt, és érdemes refaktorra ütemezni.
A W08-ban Anthropic Claude 3.7 Sonnet várható, és a Grok-3 első benchmark-eredményei.
Források
Fő forrás — Nate B Jones csatornája:
- 2025-02-11 · AI Misalignment: Gemini Flash Tries to Charge a User $5 — agent financial side-effect veszély.
- 2025-02-11 · AI News: Mistral is Back, DeepSeek Owns ai.com, Sam’s 3 Laws — Mistral-update, ai.com-rejtély.
- 2025-02-12 · ChatGPT 5 and Project Orion: Official Updates from OpenAI — Sam roadmap-elemzés, három modell-osztály.
- 2025-02-13 · How DeepSeek Reset the AI Game and Then Lost to OpenAI — Challenger-vs-domináns stratégia.
- 2025-02-14 · Meta is Building Robots and AI Brain Implants, Claude 4 Soon — Meta humanoid stratégia, Claude 4 rumor.
Primer forrás — Anthropic hivatalos:
- 2025-02-13 · Tips for Building AI Agents — Erik, Barry, Alex (kutatás / applied AI / Claude relations) — workflow vs agent definíció, verifikálhatósági sweet spot, “be empathetic to the model”.
Körbejárás / tech-mélység — Latent Space podcast:
- 2025-02-11 · The AI Architect — Bret Taylor (Sierra) — multi-agent enterprise architektúra, ex-Salesforce / Twitter perspektíva.
- 2025-02-13 · Smol Agents are All You Need — minimalista agent-framework, kevesebb mint 100 sor python.
Fact-check és hivatkozott eredeti források:
- Sam Altman X-poszt — GPT-5 / GPT-4.5 roadmap (2025-02-12)
- Fortune — Sam Altman lays out plans for GPT-5 and GPT-4.5
- Decrypt — One AI to Rule Them All
- Anthropic — Building Effective Agents (eredeti blogposzt)
- TechCrunch — OpenAI Deep Research rolls out to paying ChatGPT users (2025-02-25)
- The Information — Anthropic readies new Claude model
A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.