Egy hét, három strukturális mozgás. Egy: a NovaSky-AI csapata UC Berkeley-ről kiad egy $450-ből betanított, 32 milliárd paraméteres reasoning-modellt, ami az o1-preview-vel paritást hoz több benchmarkon. Kettő: a Google Research Titans-papert publikál, ami egy új memória-architektúrával 2 millió tokenes kontextust kezel — és ugyanazon a héten a Hailuo (kínai startup) MiniMax-01-et open-source-ra teszi, 4M token kontextussal. Három: a Cursor / Anysphere januárban átlépi a $100M ARR-t, 12 hónap alatt — gyorsabb skálázás, mint amit a SaaS-iparág valaha látott — és ezzel akkora GPU-éhséget vált ki, hogy az Anthropic mérnöki döntéseit közvetlenül befolyásolja. A három mozgás közös nevezője: a W01-ben emlegetett “pre-training scaling fal” után a következő frontvonal három irányba nyílt — olcsóbb reasoning, hosszabb memória, gyorsabb agent-deployment — és mindhárom ezen a héten konkrét milestone-t kap.
Sky-T1 — $450-ért lemásolható az o1-preview
Január 13-án a NovaSky-AI (UC Berkeley Sky Computing Lab) publikálja a Sky-T1-32B-Preview-t. A számok, amiket Nate a 13-i videójában emel ki: 32 milliárd paraméter, $450 betanítási költség, 19 óra 8 darab Nvidia H100-as GPU-n. A módszer nem mágia: Qwen2.5-32B-Instruct alapra finomhangolnak, a tanító adatot az Alibaba QwQ-32B-Preview reasoning-modellel generálják, és OpenAI GPT-4o-mini-vel formázzák workable formátumra. A TechCrunch leírása szerint a benchmark-eredmény: MATH500 és LiveCodeBench-en megveri az o1-preview-t, GPGA-Diamond-on (PhD-szintű fizika/biológia/kémia) alulmarad.
A teljes csomag — kód, adatkészlet, HuggingFace-súlyok, tréning-script — open-source. Ez az első valóban end-to-end reprodukálható reasoning-modell. Ami nem azt jelenti, hogy o1-tel egyenrangú; hanem azt, hogy a reasoning-réteg distillálható, és aki rendelkezik egy nagyobb reasoning-modellel (mint Alibaba QwQ), az 490 dolláros nagyságrendben képes egy másik domain-specifikus modellt rajta keresztül feltölteni.
Tech-implikáció: a Frontier Lab-ek (OpenAI, Anthropic, Google) költségelőnye egy adott képesség első kiadásakor maximális, de 6-12 hónap alatt distillálódik le open-source-ra, nagyságrendekkel olcsóbb költségen. Ezért szólt a W01-es Latent Space évösszefoglaló az “inference-time compute” pivotról: a labor-előny a service-szinten marad, nem a modellben.
Titans — a Google új memória-architektúrája
Január 14-én Nate külön videót szentel a Google Research most publikált “Titans: Learning to Memorize at Test Time” paperjének. A magyarázat lényege egyszerű, de a következménye nem.
A klasszikus Transformer-architektúra kvadratikus komplexitással számol token-relációkat: ha 100 ezer tokent kezelsz, az 10 milliárd reláció, és ezért lassú a hosszú kontextus. A Titans két memóriát vezet be: rövid távú memória (sliding window attention, mint a klasszikus Transformer, lokális dependenciákra) és hosszú távú memória (külön neural module, ami egy multi-layer perceptron). A hosszú távú memória nem újraszámolja az összes relációt minden lekérdezésnél, hanem szelektíven jegyzi meg azokat a tokeneket, amiket a modell “meglepőnek” érzékel (nagy gradient-jel jön a memória-update-en). Eredmény: 2M+ token kontextus lineáris skálázással.
A Google Research blogja három architektúra-variánst említ: Memory as Context (MAC), Memory as a Gate (MAG), Memory as a Layer (MAL). A paperben szerző-csapat azt állítja, hogy a Titans a BABILong-tesztsoron GPT-4-et megveri sokkal kevesebb paraméterrel — fontos benchmark a long-context retrieval mérésére.
Ami egy mérnöknek itt érdekes: ha a memória-problémát nem a kontextus-ablak növelésével, hanem architekturális módon oldjuk meg, akkor a következő évben a “context engineering” fogalom is változik. Ma RAG-eket építünk, mert nem fér be minden a kontextusba. A Titans-utáni világban (vagy a hasonló memória-modulokat integráló utódmodelleknél) a modell maga építi a saját külső memóriáját, és a RAG egy különleges esete válik egy általánosabb mintázatnak.
Hosszú-kontextus verseny — MiniMax-01 és ChatGPT memory-beta
Ugyanazon a héten a Shanghai-i Hailuo AI publikálja a MiniMax-01-sorozatot: MiniMax-Text-01 és MiniMax-VL-01, 456 milliárd paraméter, 4M token kontextus inference-időben (trained on 1M), 100%-os Needle-in-a-Haystack pontosság 4M-en. Az architektúra-újítás itt is alternatív: Lightning Attention mechanizmust használnak, ami állítólag 20-32× hatékonyabb kontextus-feldolgozásban, mint a klasszikus Transformer. Open-source kiadás, $850M funding a háttérben.
Plus: az OpenAI ChatGPT-ben advanced memory beta-rollout indul néhány felhasználónál — még nem világos, hogy a “advanced” jobb minőségű memóriát vagy nagyobb mennyiséget jelent. Nate a 15-i videójában összerakja a három pontot: Titans + MiniMax + ChatGPT memory mind ugyanazon a héten — ez nem véletlen, hanem az iparág szinkronizált válasza a memória-problémára. 2025 első nagy témája egyértelmű.
Mayo Clinic AI — radiológia és genomika élesben
Egy ritkán emelt téma a hírlevélbe: a Mayo Clinic ezen a héten két konkrét AI-deployment-et publikál. Az első egy radiology-workflow automatizáció: röntgen-képek elemzése, csövek és vezetékek elhelyezésének értékelése, mellkas-röntgen change-detection. A második — Azure-rel közös projekt — egy referencia humán-genom adatkészlet építése, amin később személyre szabott orvoslást terveznek. Magasan szabályozott, magas tét, saját adatkészlettel — a Mayo Clinic-nek nem kell prototípus-fanf, hanem deploy-ható eszköz. Ez a 2025-ös enterprise-AI-deployment legfontosabb mintája.
Cursor $100M ARR — és az Anthropic GPU-piacának nyomása
Január közepén a Cursor / Anysphere átlépi a $100M ARR küszöböt, 12 hónap a launch óta. A korábbi rekord a Slack-é volt 15 hónappal — a Cursor a leggyorsabb a SaaS-történelemben, marketing-spend nélkül. A Contrary Research adatai megerősítik: június 2025-re $500M, november 2025-re $1B, február 2026-ra $2B ARR — a 0-ról 2 milliárdig zerus három év, ami jobb mint Slack/Zoom/Snowflake.
Nate a 16-i videójában egy érdekes mellékéságot említ: a Cursor olyan gyorsan nő, hogy az Anthropic minden GPU-jét felfalja, és cserébe a Claude default response-ja “concise” módra állítódik. Ezt az Anthropic explicit kommunikálja, és Nate gyanúja szerint az AWS-deal (ahol az Anthropic AWS-saját chip-eket vesz) is részben emiatt köttetett. Ez egy jó példa a rendszer-szintű GPU-effektre: egyetlen ügyfél növekedése konkrét default-állításokat változtat meg másoknál.
Mellékszál — o1 nem egy chat-model (Latent Space)
Január 17-én a Latent Space interjúzik a témáról, miszerint az o1-et (és a hasonló reasoning-modelleket) nem chat-modelnek kell használni. A részlet, amit kiemelnek: o1-nek nem prompt kell, hanem success criteria + kontextus-massza. Aki a klasszikus chat-pattern-nel (“kérdés → válasz”) áll neki, az “skill issue”-t fog érezni; aki előre megfogalmazza, mit akar elérni, és odateszi a kontextust, az látni fogja, miért fizet többet a reasoning-tokenekért. Ez közvetlenül összeér a Karpathy-féle keret-tézissel (“give models success criteria and watch them go”), és előjelzi, hogy a 2025-ös prompt-engineering visszább lép, a success-criteria-engineering kerül előtérbe.
Mellékszál — DeepSeek v3 előzetes (Latent Space)
Január 19-én a Latent Space külön epizódot szentel a DeepSeek v3-nak és az SGLang inference framework-nek. Ez most még csak technikai mély-merülés, de a következő hét leg-fontosabb hír-eseménye is részben innen indul: a DeepSeek R1, és a január 27-i amerikai tőzsde-pánik. Aki figyelni akar 2025-ben az open-source frontier-vonalat, ezt az epizódot érdemes meghallgatni a háttérre.
Mellékszál — gyors hírek a hétről
- OpenAI–Axios deal: az OpenAI négy új newsroom-ot finanszíroz az Axios-nak, cserébe ChatGPT-search-láthatóságért. A B2B-press-világ új monetizációs mintája.
- OpenAI rant prevalence KPI: ismerted, hogy az LLM-ek néha “exisztenciálisan rant-elnek”, ha többször ugyanazt a szót kell ismételniük? A Frontier Lab-eknél van mérőszám ennek csökkentésére. Anekdotikus, de releváns: a modell-viselkedés mérhetővé vált, és a default-tone-adatok ennek a számnak a függvényei.
- Microsoft MatterGen: Microsoft Research új modellje, ami új anyagokat tervez. Sam Altman superintelligence-tézisének egyik konkrét megnyilvánulása — a “AI fizikát találhat” állítás első, hard-tudományi prototípusa.
- Suchir Balaji ügye: a San Francisco-i rendőrség újra megnyitja az OpenAI-whistleblower halálügyét új bizonyítékok alapján. Nem AI-tech, de a vállalatra vonatkozó governance témája.
Mit viszünk magunkkal
A hét három tanulsága mérnöki / IT-vezetői oldalon:
- A reasoning-réteg ára összeomlik. Tervezz erre. Ha most azt mérlegeled, hogy egy adott domain-feladatra Frontier-modellt vagy saját finetuned reasoning-stack-et használj, a Sky-T1-szerű distillációs path azonnali tárgyalási alappont — nem azonnal éles, de a vendor-lock-in elkerüléséhez érdemes legalább evaluációt tartani róla.
- A memóriaproblémát ne RAG-gel oldd, ha nem muszáj. Ha a Titans-szerű architektúrákra építve a következő modellgeneráció natív 2M+ kontextust ad lineáris skálázással, akkor sokat-kontextusú workflow-knál érdemes várni egy iterációt — vagy legalább nem reflexszerűen RAG-pipeline-t építeni minden long-context probléma alá. A “context-engineering” fogalom heten belül változott.
- A vendor-rendszerszintű effektek hatnak rád is. A Cursor-Anthropic-deal-példa azt mutatja, hogy egy harmadik szereplő növekedése a saját termékeden konkrét default-állítást változtathat. A Claude-on építő enterprise architektúrában érdemes explicit beállításokat tartani (effort-level, system-prompt) ahelyett, hogy a vendor default-jaira támaszkodnánk.
A W04-ben Stargate ($500B), OpenAI Operator-launch, és az Anthropic-OpenAI nyilvános eltérése a superintelligence-timing kérdésében — a jelek szerint az év első nagy hét-feszültségére számíthatunk.
Források
Fő forrás — Nate B Jones csatornája:
- 2025-01-13 · 9 AI Stories: AI Agents Coding, a $450 Model Matches o1 Preview — Sky-T1, Hyperbolic Labs, Cursor, energy use, Grok diagnózis.
- 2025-01-14 · Google Research Paper Titans Architecture Solves AI Memory — Titans-paper magyarázat, dual memory.
- 2025-01-15 · Mayo Clinic AI, Reddit LLM Summaries, 4M Token Context — MiniMax-01, ChatGPT memory beta, Mayo Clinic deployment.
- 2025-01-16 · ChatGPT Rants, Cursor Putting GPU Pressure on Anthropic — rant prevalence KPI, Cursor-Anthropic GPU-piac, Transformer Squared.
- 2025-01-17 · Tools for AI Agent Builders, Mattergen from Microsoft — Agent Recipes, MatterGen, Synthesis (AI math tutor).
Körbejárás / tech-mélység — Latent Space podcast:
- 2025-01-17 · OpenAI o1 isn’t a chat model — and that’s the point — reasoning-modellek success-criteria-engineering paradigma.
- 2025-01-19 · DeepSeek v3, SGLang and the State of Open Model Inference — open-source frontier elemzés, előjáték a W04-hez.
Fact-check és hivatkozott eredeti források (saját kereséssel verifikálva):
- Sky-T1 hivatalos oldal — NovaSky-AI
- TechCrunch — Researchers open source Sky-T1 (less than $450)
- Sky-T1-32B-Preview — HuggingFace
- Titans paper — arxiv:2501.00663
- Google Research blog — Titans + MIRAS
- VentureBeat — MiniMax 4M token context window
- Anysphere / Cursor — Wikipedia (ARR-history)
- Contrary Research — Cursor Business Breakdown
A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.