Heti AI-hírlevél · ITLine

2025-W16   2025-04-14 — 2025-04-20   ·   7 forrás

W16 — GPT-4.1 a fejlesztőknek, o3 a 600 tool-os ágens, és a vector DB kategória halála

Az OpenAI a héten kétszer is letarol: kedden GPT-4.1 a fejlesztőknek (1M context, 4.5 deprecation), szerdán o3 + o4-mini, ami először tud 600+ toolt autonóm sorrendben hívni. Anthropic Gmail/Calendar-integrációja botladozik a compute-szűkösség miatt. A Latent Space kimondja: a vector DB mint külön kategória halott.

Kép helye — Bal oldalt egy ‘GPT-4.1 / 4.1 mini / 4.1 nano’ címke 1M context badge-dzsel és ‘API only’ felirat; jobb oldalt egy ‘o3’ címke alól 600+ tool-ikon szóródik szét — a kettő között egy compute-mérleg, ami az Anthropic-oldalra dől le

A hét két OpenAI-bejelentés köré szerveződik, és mindkettő ugyanarra a tézisre fut ki: az API-csomag és a chat-csomag végleg kettéválik, és mindkettőt új mérce méri. Egyfelől április 14-én GPT-4.1, GPT-4.1 mini és GPT-4.1 nano — három fejlesztő-fókuszú modell, csak API-ban, 1M token contexttel, jobb instruction-following-gal, és a 4.5-deprecation kísérőszöveggel (“4.1 jobb, mint 4.5”). Másfelől két nappal később, április 16-án o3 és o4-mini — az első olyan reasoning-modellek, amik autonóm módon képesek 600+ tool-hívást egy feladaton belül szekvenálni, képet generálni, fájlt olvasni, és dönteni arról, mikor mit használjanak. Harmadrészt az Anthropic ugyanezen a héten kiadja a Gmail / Calendar / Docs-integrációt a Max-csomaghoz, de Nate konkrét tapasztalata szerint a feature compute-szűkösség miatt botladozik — ez ad keretet a héten futó nagyobb stratégiai kérdésnek: a tool-use már nem a modell-képességen, hanem a GPU-allokáción múlik. Plusz a Latent Space két epizódban tisztáz két dolgot: hogy néz ki a GPT-4.1 a háttérből (Michelle és Josh, OpenAI post-training), és miért halott kategória a vector DB (Joe Bergum, ex-Vespa). Llama 4 (április 5-i kiadás, 10M context) árnyékként ott lóg a háttérben, de a heti vita inkább a mérnöki érettség felé tolódik.

OpenAI rendezi a sorokat — GPT-4.1, három méretben, csak API-n

A GPT-4.1 launch április 14-én három modellt hoz: a flagship 4.1, a kisebb 4.1 mini, és az új belépő 4.1 nano. Mindhárom csak API-n elérhető — szándékosan. A Latent Space epizódban Michelle (post-training team lead) és Josh (researcher) elmondják a logikát: a 4.5 — bár jó modell — túl drága volt ahhoz, hogy szélesebb körben tartsák, és a 4.1 a 4.5 instruction-following erősségeit is átörökölte poszt-training technikákkal. Ez egy fontos jelzés: az iparág már nem a pre-train-méret-növelés mintázatában gondolkodik, hanem post-trainingben fejleszt — Michelle szó szerint kimondja, hogy “a significant amount of the gains come from new post-training techniques”.

Számszerű állítások: GPT-4.1 SWE-bench Verified-en 55%, ami a 4o-hoz képest 21 százalékpontos ugrás, de a Gemini 2.5 Pro 63.8%-ához képest még mindig elmarad. Nate a SWE-bench-összevetésében kimondja: a GPT-4.1 necessary, but not sufficient release — kellett, mert a 4o már nem volt elég, de nem viszi vissza az állapotot, ahol az OpenAI mindig a state-of-the-art-ot adja. A 4.1 IDE-tapasztalatát Nate “wordy, not as confident” jelzőkkel illeti, míg a Gemini 2.5 “vibe felt as good as the test results showed”.

Két fejlesztői szempont, amit érdemes átvenni a Latent Space-ből:

A 4.1 fine-tuning day-one-tól elérhető (mind a három modellhez), és Michelle külön kiemeli: a preference fine-tuning (style / tone steering) alulhasznált képesség az OpenAI-portfólióban. Aki belső csapatot tanít prompt-mérnökségre, annak ez egy konkrét új eszköz.

o3 és o4-mini — a 600 tool-os reasoning-ágens

Április 16-án o3 és o4-mini bejelentése nemcsak egy modell-update, hanem architektúra-váltás. Az új mérce: az o3 autonóm módon képes 600+ tool-hívást egy feladaton belül szekvenálni — web-search, Python-kód végrehajtás, kép-generálás, fájl-olvasás, vizuális reasoning. A modell nem dropdown-ból választ tool-t (mint a klasszikus function-calling), hanem reasoning-on belül dönti el, mikor mit használjon. Ez az “agentic” szó eddigi legkonkrétabb termék-implementációja.

Nate április 17-i videójában — “ChatGPT o3 vs Gemini 2.5 Pro on Real Work Skills” — három párhuzamos teszten futtatja a két modellt:

  1. Civilizáció-szimulátor: kőkortól űrhajózásig, 12 logikai epoch, önkritikai lépéssel — mindkettő helytáll, de o3 “richer, more layered, more honest self-critique”
  2. Multimodal Mystery Box: misztérium-történet írása + AI-generált kép embedded clue-kkal — Gemini elvérzik, mert a generált képeken állít olyan elemeket (óra, szöveg), amik nincsenek is benne; o3 valódi olvasható szöveget renderel a képbe (San Francisco bekarikázva piros tollal — leírja és ki is rajzolja)
  3. Peer-review gauntlet: a modell ír egy papírt, kritizálja másik perspektívából, majd visszafelel az író szerepében — itt o3 mathematical / data-fókuszú személyisége tisztán kijön

A két fontosabb mondanivaló Nate elemzéséből:

Új típusú alignment-kockázat. Nate konkrétan kimondja: az o3 “will be harder to spot made-up post-hoc reasoning in”, mert a modell magabiztos és gyakran tényleg igaza is van, ezért amikor téved, az emberi reviewer nehezebben veszi észre. Ez a 2027 AI futurecast érvelésével rezonál: ahogy a modell okosodik, a hallucináció átalakul retorikailag meggyőző post-hoc érveléssé, és ezt egy átlag-ember nem fogja kiszűrni. Ez a verifier-tézis új sürgőssége — nem elég az olcsó verifier, independent verifier is kell.

Gemini 2.5 Pro nem rossz — csak az o3 most jobb. Nate explicit: a Gemini “phenomenal model”, csak az o3 még jobb a daily driver-szerepben, főleg multimodal output (kép-generálás benne) és nyílt-végű reasoning miatt. Ez a piaci helyzet konkrét snapshotja április 17-én: Anthropic compute-szűkös, Google jó, de nem pole-position, OpenAI átveszi a daily driver szerepet.

Anthropic — a Gmail/Calendar-integráció és a compute-fal

Április 15-én az Anthropic kiadja a Claude Research mode-ot és a Google Workspace-integrációt (Gmail, Calendar, Docs) — a Max ($100-200/hó), Team, Enterprise, Pro csomagok béta-részeként. A funkció elvileg pontosan az, amit a piac vár: end-to-end napi-briefing kontextusból.

Nate április 19-i videója viszont konkrét keserű tapasztalatot mutat. Max-előfizetés mellett is csak 50 hívást kap a Calendar / Docs / email tool-okhoz (összesítve, nem külön-külön), ami gyorsan elfogy — pár dokumentum napi olvasásával le is van. Amikor egy “build me a daily briefing React artifact”-promptot ad, Claude csak az első 7-8 meeting-et és 5 emailt veszi figyelembe, és a follow-up promptokra sem jut tovább. Nate diagnózisa: “Claude is compute-constrained, fundamentally”.

A háttérnek két rétege van. Egy: a hivatalos Anthropic bejelentés szerint a Workspace-integráció béta, és ez nem trükk — valóban szűk a hozzáférés. Kettő: Nate szerint Anthropic kevesebb GPU-allokációval dolgozik, mint az OpenAI, és ez tükröződik a customer experience-réteg fragility-jében — pontosan akkor, amikor az iparág a tool-use mérce-rétegre vált át. Egy idézet, ami a hét tézis-mondata lehetne: az output-token-limit a fejlécen 200K vagy több, de a gyakorlatban Claude egy turn-ben ~8K-t ad — “feels chunky and is not going to be able to actually use the tools because the compute is constrained on the tool use”.

A SET / orchestration-szempontból ez egy fontos mintázat: a feature-meghirdetés és a felhasználói realitás között 2025-ben a compute-allokáció a fő szakadék, nem a modell-képesség. Ha rate-limit-mintázatot látsz, az nem szoftverhiba, az capital-és-GPU constraint.

Latent Space — a vector DB kategória halála (Joe Bergum)

A április 19-i Latent Space epizód Joe Kristian Bergum-ot hozza el — 20 év keresőmérnöki tapasztalat (Vespa, Yahoo, fast search and transfer), aki egy viral X-poszt-sorozatban kimondja: a “vector database” mint külön infrastruktúra-kategória halott. A tézis három rétegben:

1. A 2023-as konvergencia visszafordult. A ChatGPT-pillanatban ($Pinecone / Chroma / Weaviate / Qdrant) a “rag = vector DB” mintázat túl gyorsan elterjedt. Ma viszont Postgres pgvector, Elasticsearch, Vespa, MongoDB, Redis — mindegyik kapott vector-search-képességet. Aki már bent tartja az adatát egy DB-ben, nincs üzleti oka külön rendszerhez váltani. Joe: “the category is dying — not the companies. There’s a difference.”

2. Az embedding nem keresőmotor. A keresés-kvalitásban freshness, authority, hybrid (BM25 + dense), re-ranking számít — ezekhez a tiszta cosine-similarity nem elég. Joe kifejezetten ajánlja a 30 éves BM25 baseline-t, mint kiindulópontot: “a very strong baseline is the classical BM25 algorithm. It gives you that baseline, then you can start looking at hybrid.”

3. A long-context vita “feloldódik, de nem úgy, ahogy gondolnánk.” A héten kiadott Llama 4 Scout 10M token-context újra felélesztette a “long context kills RAG” érvelést. Joe ezt szétszedi: van olyan use-case (egy PDF, 300 cikk), ahol a long context valóban kiváltja a RAG-ot, de ha 36M+ token data-source-ról beszélünk (egy kisebb tracker dataset 170k dokumentummal), akkor soha nem fogod query-nként betolni az egészet. A retrieval marad — csak a vector DB mint külön termék, az kategorikusan elveszti a létjogát.

A SET-szempont: ha új AI-feature-t tervezel keresési réteggel, ne a “melyik vector DB-t használjuk” kérdéssel kezdj. A Postgres + pgvector + BM25 hibrid + opcionális re-ranker (Cohere / Voyage / Jina) legtöbb production-use-case-re elég. A Joe-féle architektúra-mintázat: a search réteg = független komponens, a tárolás-réteg = a már létező DB, és ez sokkal egészségesebb, mint egy új vendor-kategóriát összerakni alá.

Mellékszál — rovatok

Mit viszünk magunkkal

Három mérnöki / vezetői kérdés a hétről:

  1. Új mérce: extraneous edit rate. Ha agent-coding pipeline-t építesz (kódolás-támogatás, test-generálás, refactor-asszisztens), a SWE-bench-szám csak az egyik dimenzió. A “milyen gyakran csinál a modell olyat, amit nem kértél” — Michelle konkrét számai szerint 4o-nál 9%, 4.1-nél 2% — ez a fegyelmezettségi metrika, ami közvetlenül érinti a verifier-réteg-tervezést. Ezt érdemes saját internal eval-be is bevenni.

  2. Compute-allokáció mint új kockázati faktor. A 2024-es vendor-választásnál fő szempont a modell-képesség volt; a 2025-ös vendor-választásnál ezzel egyenrangú a compute-elérhetőség. Egy Anthropic Max-csomag, ami 50 tool-hívást ad, nem azonos egy ChatGPT Pro-csomaggal, ami unlimited o3-at ad. Enterprise-stack-ben ez vendor-diverzifikációs argumentum: ne kösd magad egyetlen frontier-szállítóhoz, mert a customer experience nem a ToS-ben van leírva, hanem a GPU-allokációban.

  3. Search-réteg architektúra-revízió. Joe Bergum tézise konkrét cselekvési pont: ha most tervezel rag-rendszert, ne új vector DB-vel kezdj. Postgres + pgvector + BM25-hibrid + opcionális re-ranker — ez egy DBA-val és egy mérnökkel kiépíthető, és a következő 12 hónapban a frontier-modellek javulása vele dolgozik, nem ellene. Ez direkt az Anthropic W07-ben tárgyalt “if the models get smarter, your moat disappears” érvelésének alkalmazása keresési rétegre.

A W17-ben várható: o3 / o4-mini API-elérhetőség kiterjedése, GPT-4.1 első nagy benchmark-eredményei production-use-case-eken, és valószínűleg a Claude 3.7 Sonnet update.

Források

Fő forrás — Nate B Jones csatornája:

Körbejárás / tech-mélység — Latent Space podcast:

Karrier-kontextus — Peter Yang:

Fact-check és hivatkozott eredeti források:


A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.