Heti AI-hírlevél · ITLine

2025-W03   2025-01-13 — 2025-01-19   ·   7 forrás

W03 — 450 dollár a csúcs-szintű érvelésért, 2 millió token a memóriára

A Sky-T1 megmutatja: 450 dollárból betanítható egy o1-szintű érvelő modell. A Google Titans-paper új memória-architektúrát közöl 2M+ token kontextushoz. A Cursor 100 millió dolláros ARR-t ér el — a leggyorsabban skálázódó SaaS a történelemben. Közben az OpenAI Operator közeleg.

Kép helye — Három grafika egymás mellett: zsugorodó dollár-jel ($450 a frontier-modellhez), kibővülő memória-vonal, és egy GPU-cluster

Egy hét, három strukturális mozgás. Egy: a NovaSky-AI csapata UC Berkeley-ről kiad egy $450-ből betanított, 32 milliárd paraméteres reasoning-modellt, ami az o1-preview-vel paritást hoz több benchmarkon. Kettő: a Google Research Titans-papert publikál, ami egy új memória-architektúrával 2 millió tokenes kontextust kezel — és ugyanazon a héten a Hailuo (kínai startup) MiniMax-01-et open-source-ra teszi, 4M token kontextussal. Három: a Cursor / Anysphere januárban átlépi a $100M ARR-t, 12 hónap alatt — gyorsabb skálázás, mint amit a SaaS-iparág valaha látott — és ezzel akkora GPU-éhséget vált ki, hogy az Anthropic mérnöki döntéseit közvetlenül befolyásolja. A három mozgás közös nevezője: a W01-ben emlegetett “pre-training scaling fal” után a következő frontvonal három irányba nyílt — olcsóbb reasoning, hosszabb memória, gyorsabb agent-deployment — és mindhárom ezen a héten konkrét milestone-t kap.

Sky-T1 — $450-ért lemásolható az o1-preview

Január 13-án a NovaSky-AI (UC Berkeley Sky Computing Lab) publikálja a Sky-T1-32B-Preview-t. A számok, amiket Nate a 13-i videójában emel ki: 32 milliárd paraméter, $450 betanítási költség, 19 óra 8 darab Nvidia H100-as GPU-n. A módszer nem mágia: Qwen2.5-32B-Instruct alapra finomhangolnak, a tanító adatot az Alibaba QwQ-32B-Preview reasoning-modellel generálják, és OpenAI GPT-4o-mini-vel formázzák workable formátumra. A TechCrunch leírása szerint a benchmark-eredmény: MATH500 és LiveCodeBench-en megveri az o1-preview-t, GPGA-Diamond-on (PhD-szintű fizika/biológia/kémia) alulmarad.

A teljes csomag — kód, adatkészlet, HuggingFace-súlyok, tréning-script — open-source. Ez az első valóban end-to-end reprodukálható reasoning-modell. Ami nem azt jelenti, hogy o1-tel egyenrangú; hanem azt, hogy a reasoning-réteg distillálható, és aki rendelkezik egy nagyobb reasoning-modellel (mint Alibaba QwQ), az 490 dolláros nagyságrendben képes egy másik domain-specifikus modellt rajta keresztül feltölteni.

Tech-implikáció: a Frontier Lab-ek (OpenAI, Anthropic, Google) költségelőnye egy adott képesség első kiadásakor maximális, de 6-12 hónap alatt distillálódik le open-source-ra, nagyságrendekkel olcsóbb költségen. Ezért szólt a W01-es Latent Space évösszefoglaló az “inference-time compute” pivotról: a labor-előny a service-szinten marad, nem a modellben.

Titans — a Google új memória-architektúrája

Január 14-én Nate külön videót szentel a Google Research most publikált “Titans: Learning to Memorize at Test Time” paperjének. A magyarázat lényege egyszerű, de a következménye nem.

A klasszikus Transformer-architektúra kvadratikus komplexitással számol token-relációkat: ha 100 ezer tokent kezelsz, az 10 milliárd reláció, és ezért lassú a hosszú kontextus. A Titans két memóriát vezet be: rövid távú memória (sliding window attention, mint a klasszikus Transformer, lokális dependenciákra) és hosszú távú memória (külön neural module, ami egy multi-layer perceptron). A hosszú távú memória nem újraszámolja az összes relációt minden lekérdezésnél, hanem szelektíven jegyzi meg azokat a tokeneket, amiket a modell “meglepőnek” érzékel (nagy gradient-jel jön a memória-update-en). Eredmény: 2M+ token kontextus lineáris skálázással.

A Google Research blogja három architektúra-variánst említ: Memory as Context (MAC), Memory as a Gate (MAG), Memory as a Layer (MAL). A paperben szerző-csapat azt állítja, hogy a Titans a BABILong-tesztsoron GPT-4-et megveri sokkal kevesebb paraméterrel — fontos benchmark a long-context retrieval mérésére.

Ami egy mérnöknek itt érdekes: ha a memória-problémát nem a kontextus-ablak növelésével, hanem architekturális módon oldjuk meg, akkor a következő évben a “context engineering” fogalom is változik. Ma RAG-eket építünk, mert nem fér be minden a kontextusba. A Titans-utáni világban (vagy a hasonló memória-modulokat integráló utódmodelleknél) a modell maga építi a saját külső memóriáját, és a RAG egy különleges esete válik egy általánosabb mintázatnak.

Hosszú-kontextus verseny — MiniMax-01 és ChatGPT memory-beta

Ugyanazon a héten a Shanghai-i Hailuo AI publikálja a MiniMax-01-sorozatot: MiniMax-Text-01 és MiniMax-VL-01, 456 milliárd paraméter, 4M token kontextus inference-időben (trained on 1M), 100%-os Needle-in-a-Haystack pontosság 4M-en. Az architektúra-újítás itt is alternatív: Lightning Attention mechanizmust használnak, ami állítólag 20-32× hatékonyabb kontextus-feldolgozásban, mint a klasszikus Transformer. Open-source kiadás, $850M funding a háttérben.

Plus: az OpenAI ChatGPT-ben advanced memory beta-rollout indul néhány felhasználónál — még nem világos, hogy a “advanced” jobb minőségű memóriát vagy nagyobb mennyiséget jelent. Nate a 15-i videójában összerakja a három pontot: Titans + MiniMax + ChatGPT memory mind ugyanazon a héten — ez nem véletlen, hanem az iparág szinkronizált válasza a memória-problémára. 2025 első nagy témája egyértelmű.

Mayo Clinic AI — radiológia és genomika élesben

Egy ritkán emelt téma a hírlevélbe: a Mayo Clinic ezen a héten két konkrét AI-deployment-et publikál. Az első egy radiology-workflow automatizáció: röntgen-képek elemzése, csövek és vezetékek elhelyezésének értékelése, mellkas-röntgen change-detection. A második — Azure-rel közös projekt — egy referencia humán-genom adatkészlet építése, amin később személyre szabott orvoslást terveznek. Magasan szabályozott, magas tét, saját adatkészlettel — a Mayo Clinic-nek nem kell prototípus-fanf, hanem deploy-ható eszköz. Ez a 2025-ös enterprise-AI-deployment legfontosabb mintája.

Cursor $100M ARR — és az Anthropic GPU-piacának nyomása

Január közepén a Cursor / Anysphere átlépi a $100M ARR küszöböt, 12 hónap a launch óta. A korábbi rekord a Slack-é volt 15 hónappal — a Cursor a leggyorsabb a SaaS-történelemben, marketing-spend nélkül. A Contrary Research adatai megerősítik: június 2025-re $500M, november 2025-re $1B, február 2026-ra $2B ARR — a 0-ról 2 milliárdig zerus három év, ami jobb mint Slack/Zoom/Snowflake.

Nate a 16-i videójában egy érdekes mellékéságot említ: a Cursor olyan gyorsan nő, hogy az Anthropic minden GPU-jét felfalja, és cserébe a Claude default response-ja “concise” módra állítódik. Ezt az Anthropic explicit kommunikálja, és Nate gyanúja szerint az AWS-deal (ahol az Anthropic AWS-saját chip-eket vesz) is részben emiatt köttetett. Ez egy jó példa a rendszer-szintű GPU-effektre: egyetlen ügyfél növekedése konkrét default-állításokat változtat meg másoknál.

Mellékszál — o1 nem egy chat-model (Latent Space)

Január 17-én a Latent Space interjúzik a témáról, miszerint az o1-et (és a hasonló reasoning-modelleket) nem chat-modelnek kell használni. A részlet, amit kiemelnek: o1-nek nem prompt kell, hanem success criteria + kontextus-massza. Aki a klasszikus chat-pattern-nel (“kérdés → válasz”) áll neki, az “skill issue”-t fog érezni; aki előre megfogalmazza, mit akar elérni, és odateszi a kontextust, az látni fogja, miért fizet többet a reasoning-tokenekért. Ez közvetlenül összeér a Karpathy-féle keret-tézissel (“give models success criteria and watch them go”), és előjelzi, hogy a 2025-ös prompt-engineering visszább lép, a success-criteria-engineering kerül előtérbe.

Mellékszál — DeepSeek v3 előzetes (Latent Space)

Január 19-én a Latent Space külön epizódot szentel a DeepSeek v3-nak és az SGLang inference framework-nek. Ez most még csak technikai mély-merülés, de a következő hét leg-fontosabb hír-eseménye is részben innen indul: a DeepSeek R1, és a január 27-i amerikai tőzsde-pánik. Aki figyelni akar 2025-ben az open-source frontier-vonalat, ezt az epizódot érdemes meghallgatni a háttérre.

Mellékszál — gyors hírek a hétről

Mit viszünk magunkkal

A hét három tanulsága mérnöki / IT-vezetői oldalon:

  1. A reasoning-réteg ára összeomlik. Tervezz erre. Ha most azt mérlegeled, hogy egy adott domain-feladatra Frontier-modellt vagy saját finetuned reasoning-stack-et használj, a Sky-T1-szerű distillációs path azonnali tárgyalási alappont — nem azonnal éles, de a vendor-lock-in elkerüléséhez érdemes legalább evaluációt tartani róla.
  2. A memóriaproblémát ne RAG-gel oldd, ha nem muszáj. Ha a Titans-szerű architektúrákra építve a következő modellgeneráció natív 2M+ kontextust ad lineáris skálázással, akkor sokat-kontextusú workflow-knál érdemes várni egy iterációt — vagy legalább nem reflexszerűen RAG-pipeline-t építeni minden long-context probléma alá. A “context-engineering” fogalom heten belül változott.
  3. A vendor-rendszerszintű effektek hatnak rád is. A Cursor-Anthropic-deal-példa azt mutatja, hogy egy harmadik szereplő növekedése a saját termékeden konkrét default-állítást változtathat. A Claude-on építő enterprise architektúrában érdemes explicit beállításokat tartani (effort-level, system-prompt) ahelyett, hogy a vendor default-jaira támaszkodnánk.

A W04-ben Stargate ($500B), OpenAI Operator-launch, és az Anthropic-OpenAI nyilvános eltérése a superintelligence-timing kérdésében — a jelek szerint az év első nagy hét-feszültségére számíthatunk.

Források

Fő forrás — Nate B Jones csatornája:

Körbejárás / tech-mélység — Latent Space podcast:

Fact-check és hivatkozott eredeti források (saját kereséssel verifikálva):


A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.