A hét két OpenAI-bejelentés köré szerveződik, és mindkettő ugyanarra a tézisre fut ki: az API-csomag és a chat-csomag végleg kettéválik, és mindkettőt új mérce méri. Egyfelől április 14-én GPT-4.1, GPT-4.1 mini és GPT-4.1 nano — három fejlesztő-fókuszú modell, csak API-ban, 1M token contexttel, jobb instruction-following-gal, és a 4.5-deprecation kísérőszöveggel (“4.1 jobb, mint 4.5”). Másfelől két nappal később, április 16-án o3 és o4-mini — az első olyan reasoning-modellek, amik autonóm módon képesek 600+ tool-hívást egy feladaton belül szekvenálni, képet generálni, fájlt olvasni, és dönteni arról, mikor mit használjanak. Harmadrészt az Anthropic ugyanezen a héten kiadja a Gmail / Calendar / Docs-integrációt a Max-csomaghoz, de Nate konkrét tapasztalata szerint a feature compute-szűkösség miatt botladozik — ez ad keretet a héten futó nagyobb stratégiai kérdésnek: a tool-use már nem a modell-képességen, hanem a GPU-allokáción múlik. Plusz a Latent Space két epizódban tisztáz két dolgot: hogy néz ki a GPT-4.1 a háttérből (Michelle és Josh, OpenAI post-training), és miért halott kategória a vector DB (Joe Bergum, ex-Vespa). Llama 4 (április 5-i kiadás, 10M context) árnyékként ott lóg a háttérben, de a heti vita inkább a mérnöki érettség felé tolódik.
OpenAI rendezi a sorokat — GPT-4.1, három méretben, csak API-n
A GPT-4.1 launch április 14-én három modellt hoz: a flagship 4.1, a kisebb 4.1 mini, és az új belépő 4.1 nano. Mindhárom csak API-n elérhető — szándékosan. A Latent Space epizódban Michelle (post-training team lead) és Josh (researcher) elmondják a logikát: a 4.5 — bár jó modell — túl drága volt ahhoz, hogy szélesebb körben tartsák, és a 4.1 a 4.5 instruction-following erősségeit is átörökölte poszt-training technikákkal. Ez egy fontos jelzés: az iparág már nem a pre-train-méret-növelés mintázatában gondolkodik, hanem post-trainingben fejleszt — Michelle szó szerint kimondja, hogy “a significant amount of the gains come from new post-training techniques”.
Számszerű állítások: GPT-4.1 SWE-bench Verified-en 55%, ami a 4o-hoz képest 21 százalékpontos ugrás, de a Gemini 2.5 Pro 63.8%-ához képest még mindig elmarad. Nate a SWE-bench-összevetésében kimondja: a GPT-4.1 necessary, but not sufficient release — kellett, mert a 4o már nem volt elég, de nem viszi vissza az állapotot, ahol az OpenAI mindig a state-of-the-art-ot adja. A 4.1 IDE-tapasztalatát Nate “wordy, not as confident” jelzőkkel illeti, míg a Gemini 2.5 “vibe felt as good as the test results showed”.
Két fejlesztői szempont, amit érdemes átvenni a Latent Space-ből:
- Az XML jobb input-formátum, mint a JSON. A GPT-4.1 prompt-guide-ja XML-strukturált promptot javasol input-oldalon (a JSON továbbra is jó output-ra). Ez egy konkrét, mérhető iparági irány: structured input != structured output, és ezt a két irányt külön kezelni érdemes.
- Az “extraneous edits” eval drámai változás. GPT-4o 9%-ban csinált felesleges módosítást a kérthez képest; GPT-4.1 csak 2%-ban. Aki agent-coding-ot tervez (Cursor / Cline / Claude Code-szerű use case), annak a modellválasztásnál ez fontosabb metrika, mint a SWE-bench-szám — azt méri, mennyire fegyelmezett a modell, nem azt, hogy összerakja-e.
A 4.1 fine-tuning day-one-tól elérhető (mind a három modellhez), és Michelle külön kiemeli: a preference fine-tuning (style / tone steering) alulhasznált képesség az OpenAI-portfólióban. Aki belső csapatot tanít prompt-mérnökségre, annak ez egy konkrét új eszköz.
o3 és o4-mini — a 600 tool-os reasoning-ágens
Április 16-án o3 és o4-mini bejelentése nemcsak egy modell-update, hanem architektúra-váltás. Az új mérce: az o3 autonóm módon képes 600+ tool-hívást egy feladaton belül szekvenálni — web-search, Python-kód végrehajtás, kép-generálás, fájl-olvasás, vizuális reasoning. A modell nem dropdown-ból választ tool-t (mint a klasszikus function-calling), hanem reasoning-on belül dönti el, mikor mit használjon. Ez az “agentic” szó eddigi legkonkrétabb termék-implementációja.
Nate április 17-i videójában — “ChatGPT o3 vs Gemini 2.5 Pro on Real Work Skills” — három párhuzamos teszten futtatja a két modellt:
- Civilizáció-szimulátor: kőkortól űrhajózásig, 12 logikai epoch, önkritikai lépéssel — mindkettő helytáll, de o3 “richer, more layered, more honest self-critique”
- Multimodal Mystery Box: misztérium-történet írása + AI-generált kép embedded clue-kkal — Gemini elvérzik, mert a generált képeken állít olyan elemeket (óra, szöveg), amik nincsenek is benne; o3 valódi olvasható szöveget renderel a képbe (San Francisco bekarikázva piros tollal — leírja és ki is rajzolja)
- Peer-review gauntlet: a modell ír egy papírt, kritizálja másik perspektívából, majd visszafelel az író szerepében — itt o3 mathematical / data-fókuszú személyisége tisztán kijön
A két fontosabb mondanivaló Nate elemzéséből:
Új típusú alignment-kockázat. Nate konkrétan kimondja: az o3 “will be harder to spot made-up post-hoc reasoning in”, mert a modell magabiztos és gyakran tényleg igaza is van, ezért amikor téved, az emberi reviewer nehezebben veszi észre. Ez a 2027 AI futurecast érvelésével rezonál: ahogy a modell okosodik, a hallucináció átalakul retorikailag meggyőző post-hoc érveléssé, és ezt egy átlag-ember nem fogja kiszűrni. Ez a verifier-tézis új sürgőssége — nem elég az olcsó verifier, independent verifier is kell.
Gemini 2.5 Pro nem rossz — csak az o3 most jobb. Nate explicit: a Gemini “phenomenal model”, csak az o3 még jobb a daily driver-szerepben, főleg multimodal output (kép-generálás benne) és nyílt-végű reasoning miatt. Ez a piaci helyzet konkrét snapshotja április 17-én: Anthropic compute-szűkös, Google jó, de nem pole-position, OpenAI átveszi a daily driver szerepet.
Anthropic — a Gmail/Calendar-integráció és a compute-fal
Április 15-én az Anthropic kiadja a Claude Research mode-ot és a Google Workspace-integrációt (Gmail, Calendar, Docs) — a Max ($100-200/hó), Team, Enterprise, Pro csomagok béta-részeként. A funkció elvileg pontosan az, amit a piac vár: end-to-end napi-briefing kontextusból.
Nate április 19-i videója viszont konkrét keserű tapasztalatot mutat. Max-előfizetés mellett is csak 50 hívást kap a Calendar / Docs / email tool-okhoz (összesítve, nem külön-külön), ami gyorsan elfogy — pár dokumentum napi olvasásával le is van. Amikor egy “build me a daily briefing React artifact”-promptot ad, Claude csak az első 7-8 meeting-et és 5 emailt veszi figyelembe, és a follow-up promptokra sem jut tovább. Nate diagnózisa: “Claude is compute-constrained, fundamentally”.
A háttérnek két rétege van. Egy: a hivatalos Anthropic bejelentés szerint a Workspace-integráció béta, és ez nem trükk — valóban szűk a hozzáférés. Kettő: Nate szerint Anthropic kevesebb GPU-allokációval dolgozik, mint az OpenAI, és ez tükröződik a customer experience-réteg fragility-jében — pontosan akkor, amikor az iparág a tool-use mérce-rétegre vált át. Egy idézet, ami a hét tézis-mondata lehetne: az output-token-limit a fejlécen 200K vagy több, de a gyakorlatban Claude egy turn-ben ~8K-t ad — “feels chunky and is not going to be able to actually use the tools because the compute is constrained on the tool use”.
A SET / orchestration-szempontból ez egy fontos mintázat: a feature-meghirdetés és a felhasználói realitás között 2025-ben a compute-allokáció a fő szakadék, nem a modell-képesség. Ha rate-limit-mintázatot látsz, az nem szoftverhiba, az capital-és-GPU constraint.
Latent Space — a vector DB kategória halála (Joe Bergum)
A április 19-i Latent Space epizód Joe Kristian Bergum-ot hozza el — 20 év keresőmérnöki tapasztalat (Vespa, Yahoo, fast search and transfer), aki egy viral X-poszt-sorozatban kimondja: a “vector database” mint külön infrastruktúra-kategória halott. A tézis három rétegben:
1. A 2023-as konvergencia visszafordult. A ChatGPT-pillanatban ($Pinecone / Chroma / Weaviate / Qdrant) a “rag = vector DB” mintázat túl gyorsan elterjedt. Ma viszont Postgres pgvector, Elasticsearch, Vespa, MongoDB, Redis — mindegyik kapott vector-search-képességet. Aki már bent tartja az adatát egy DB-ben, nincs üzleti oka külön rendszerhez váltani. Joe: “the category is dying — not the companies. There’s a difference.”
2. Az embedding nem keresőmotor. A keresés-kvalitásban freshness, authority, hybrid (BM25 + dense), re-ranking számít — ezekhez a tiszta cosine-similarity nem elég. Joe kifejezetten ajánlja a 30 éves BM25 baseline-t, mint kiindulópontot: “a very strong baseline is the classical BM25 algorithm. It gives you that baseline, then you can start looking at hybrid.”
3. A long-context vita “feloldódik, de nem úgy, ahogy gondolnánk.” A héten kiadott Llama 4 Scout 10M token-context újra felélesztette a “long context kills RAG” érvelést. Joe ezt szétszedi: van olyan use-case (egy PDF, 300 cikk), ahol a long context valóban kiváltja a RAG-ot, de ha 36M+ token data-source-ról beszélünk (egy kisebb tracker dataset 170k dokumentummal), akkor soha nem fogod query-nként betolni az egészet. A retrieval marad — csak a vector DB mint külön termék, az kategorikusan elveszti a létjogát.
A SET-szempont: ha új AI-feature-t tervezel keresési réteggel, ne a “melyik vector DB-t használjuk” kérdéssel kezdj. A Postgres + pgvector + BM25 hibrid + opcionális re-ranker (Cohere / Voyage / Jina) legtöbb production-use-case-re elég. A Joe-féle architektúra-mintázat: a search réteg = független komponens, a tárolás-réteg = a már létező DB, és ez sokkal egészségesebb, mint egy új vendor-kategóriát összerakni alá.
Mellékszál — rovatok
- Llama 4 (április 5.) — előző heti kiadás, idehat: Meta kiadta a Llama 4 családot (Scout 10M context, Maverick 1M context, Behemoth még tréningben). Az interconnects.ai elemzése szerint a release “panic button” jellegű — a benchmarkok a hivatalos blogban látszólag erősek, de production-tapasztalatok kevertek. A 10M context iparági mérce, de a Joe Bergum-féle kritika ide is vonatkozik: a context-méret nem helyettesíti a retrieval-réteget.
- Peter Yang (április 20.) — “stop asking for permission”: karrierfókuszú videó, ami egy érdekes mellék-tézist visz be: az AI-korszakban a “code and media as permissionless leverage” mintázat (Naval idézet) konkrétan jelenik meg — az AI annyi prototyping-erőt ad egyetlen embernek, hogy a klasszikus credentials-pálya (top-college → top-tech-company) kevésbé differenciál, mint a “just ship it” attitűd. SET-belső áthatás: a junior-szakember-fejlesztésnél ez egy releváns érv arra, hogy prototype-építést és portfolio-t preferáljuk certifikációval szemben.
- Nate strategy-videó (április 15.) — “you need an AI strategy”: 50% YC-startup outdated, mire a kohort véget ér — a model-makers leettek a use-case-ek alól. Nate Richard Rumelt-féle keretet ajánl: diagnosis → guiding policy → coherent action. Ez az enterprise AI-tervezésnél is használható szempont — saját stratégia nélkül a frontier-modell minden hónapban át fog hajtani egy belső projekten.
Mit viszünk magunkkal
Három mérnöki / vezetői kérdés a hétről:
Új mérce: extraneous edit rate. Ha agent-coding pipeline-t építesz (kódolás-támogatás, test-generálás, refactor-asszisztens), a SWE-bench-szám csak az egyik dimenzió. A “milyen gyakran csinál a modell olyat, amit nem kértél” — Michelle konkrét számai szerint 4o-nál 9%, 4.1-nél 2% — ez a fegyelmezettségi metrika, ami közvetlenül érinti a verifier-réteg-tervezést. Ezt érdemes saját internal eval-be is bevenni.
Compute-allokáció mint új kockázati faktor. A 2024-es vendor-választásnál fő szempont a modell-képesség volt; a 2025-ös vendor-választásnál ezzel egyenrangú a compute-elérhetőség. Egy Anthropic Max-csomag, ami 50 tool-hívást ad, nem azonos egy ChatGPT Pro-csomaggal, ami unlimited o3-at ad. Enterprise-stack-ben ez vendor-diverzifikációs argumentum: ne kösd magad egyetlen frontier-szállítóhoz, mert a customer experience nem a ToS-ben van leírva, hanem a GPU-allokációban.
Search-réteg architektúra-revízió. Joe Bergum tézise konkrét cselekvési pont: ha most tervezel rag-rendszert, ne új vector DB-vel kezdj. Postgres + pgvector + BM25-hibrid + opcionális re-ranker — ez egy DBA-val és egy mérnökkel kiépíthető, és a következő 12 hónapban a frontier-modellek javulása vele dolgozik, nem ellene. Ez direkt az Anthropic W07-ben tárgyalt “if the models get smarter, your moat disappears” érvelésének alkalmazása keresési rétegre.
A W17-ben várható: o3 / o4-mini API-elérhetőség kiterjedése, GPT-4.1 első nagy benchmark-eredményei production-use-case-eken, és valószínűleg a Claude 3.7 Sonnet update.
Források
Fő forrás — Nate B Jones csatornája:
- 2025-04-15 · ChatGPT 4.1 vs Gemini 2.5 — analysis on test results and actual usage — SWE-bench összevetés, IDE-tapasztalat, “necessary but not sufficient”.
- 2025-04-15 · You need an AI strategy to survive the headlines — here’s how — Rumelt-keret (diagnosis / guiding policy / coherent action), 50% YC-startup outdated.
- 2025-04-17 · ChatGPT o3 model breakdown vs Gemini 2.5 Pro — o3 work skills — három párhuzamos teszt, “harder to spot made-up post-hoc reasoning” alignment-kockázat.
- 2025-04-19 · I paid for Claude’s Gmail superpower and Anthropic’s compute constraint — 50-tool-hívás-limit Max-előfizetésen, compute-fal.
Körbejárás / tech-mélység — Latent Space podcast:
- 2025-04-15 · GPT-4.1 — The New OpenAI Workhorse (Michelle & Josh, OpenAI post-training) — három modell architektúra, 1M context, post-training-eredmények, XML-input-format, extraneous edit eval.
- 2025-04-19 · The Rise and Fall of the Vector DB Category — Joe Kristian Bergum — 20 év keresőmérnöki háttér, “category is dying”, BM25 mint baseline, long-context-vs-RAG-feloldás.
Karrier-kontextus — Peter Yang:
- 2025-04-20 · Feeling stuck? Stop asking for permission to do great work — “code and media as permissionless leverage” (Naval), AI mint prototype-erősítő junior-fejlesztőknek.
Fact-check és hivatkozott eredeti források:
- OpenAI — Introducing GPT-4.1 in the API (2025-04-14)
- TechCrunch — OpenAI’s new GPT-4.1 AI models focus on coding
- OpenAI — Introducing OpenAI o3 and o4-mini (2025-04-16)
- Forward Future AI — o3 is a milestone moment: tool usage changes everything (600+ tool calls)
- TechCrunch — Anthropic’s Claude can now read your Gmail (2025-04-15)
- SiliconANGLE — Anthropic adds research tool, Google Workspace integration to Claude
- Meta AI — The Llama 4 herd (2025-04-05)
- Helicone — Gemini 2.5 Pro Benchmarks & Integration Guide (SWE-bench 63.8%)
- Interconnects.ai — Llama 4: Did Meta just push the panic button?
A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.