Csendesebb hét, de a Frontier-iparág négy különböző irányból ugyanazt mondja: a modell-réteg most nem méretben, hanem fókuszban élesedik. Egyfelől a Sesame március elején publikálja a CSM voice-modellt, amit Nate B Jones szerint az agya emberként kezel — még ha tudja is, hogy LLM —; és Apple közben bejelenti, hogy a smart-Siri 2027-ig csúszik. Másfelől az Alibaba március 5-én kiadja a QwQ-32B-t — egy 32 milliárd paraméteres reasoning-modellt, ami a 20-szor nagyobb DeepSeek-R1-et matematikán, kódolásán és reasoning-benchmark-okon megközelíti, agresszív RL-finomhangolással. Harmadrészt a Latent Space két interjút ad ki: David Hershey-vel a Claude plays Pokémon mögötti agent-harness-ről, és Misha Laskinnal a Reflection AI stealth-ből kilépéséről. Negyedrészt Peter Yang interjúzik Scott White-tal, a Claude termékfej-ével, a Claude 3.7 Sonnet és a Claude Code mögötti termék-fejlesztési filozófiáról. A hét közös szála: a kódolás nem egy a sok agent-feladat közül — sok kutató szerint a kódolás az a “prior”, amin keresztül az általános intelligencia is szakszerűen formálható.
A Sesame voice és az uncanny valley átlépése
A Sesame egy új San Francisco-i lab, ami konverzációs hangmodellre szakosodott. A március elején publikált CSM-architektúra (Conversational Speech Model) Llama-backbone-ra épül, és nem csupán szövegből generál hangot — a teljes konverzációs kontextust beolvassa, és arra hangolja a tónust, az érzelmet, a tempót. Március 13-án a CSM-1B variánst Apache 2.0-ás licenc alatt is open-source-olják.
Nate B Jones március 5-i hangulatkép-elemzésében konkrét élmény-leírást ad. Idézet, saját keretben:
“My brain doesn’t buy it. My brain is interacting with it like it’s human because it sounds so human. It pauses, it has the little disregulation in speech that we humans have, like ‘uh’ or taking a breath. Yes, this can take a breath.” — Nate B Jones, 2025-03-05
A mérnöki tanulság: a “human-érzet” nem csak a szintézis-minőségből jön, hanem abból, hogy a modell a teljes diskurzust látja kontextusként. Az emberi beszéd tele van mikro-jelekkel (szünetek, lélegzés, disfluencia), és ha a modell ezeket kontextusból következteti, nem csak hozzáadja, akkor a hallgató agya nem tudja megkülönböztetni.
Nate két piaci megállapítást tesz. Az egyik: az Apple bejelentette, hogy az LLM-alapú új Siri 2027-ig nem érkezik — az iparág legnagyobb voice-disztribúciós felülete legalább két évre lemarad. A másik: a jó hang-modelleket általában kis labok csinálják (Sesame, ElevenLabs), míg a nagy cégek disztribúciós erővel és felvásárlással lépnek be (Amazon Alexa+ a Claude-ra épül). Architektúra-szempontból: a voice-stack 2025-ben nem érdemes egy vendor-on belül — a hang-modul specializált, cserélhető komponens.
QwQ-32B — kis modell, agresszív RL
Március 5-én az Alibaba kiadja a QwQ-32B-t — egy 32 milliárd paraméteres reasoning-modellt Apache 2.0 licenc alatt. A Hugging Face-leírás szerint a modell DeepSeek-R1 (671 milliárd paraméter, 37 milliárd aktív) szintjén teljesít matematikán, kódolásán és reasoning-benchmark-okon — ez kb. 20-szoros méretcsökkenés. A futtatáshoz VentureBeat szerint kb. 24 GB vRAM elegendő, szemben a teljes R1-hez szükséges 1500+ GB-tal.
A QwQ-blogposzt ezt kétlépcsős RL-recepttel magyarázza. Első lépcső: matematika és kódolás-feladatokon outcome-based reward — a matekot pontosság-verifier ellenőrzi, a kódot kódfuttatási szerveren verifikálják. Vagyis nem reward-modell, hanem deterministic verifier ad jelet. Második lépcső: általános képességek RL-tuningja (instruction-following, alignment), ami nem rontja le a kódolás/matek-teljesítményt. Az eredmény: kis modell, ami nagyon szűk feladat-térben majdnem-felzárkózik a 20-szor nagyobbhoz.
Nate B Jones március 6-i elemzésében jó plasztikus metaforát ad: a QwQ-32B olyan, mint egy üvegnyíl — pontosan a célra mutat, képes rendkívüli teljesítményre azon, amire trenírozták, de törékeny. Idézet:
“It can be pointed at the center of the target, it can hit it, it can deliver extraordinary performance for things it’s been trained for — but it’s fragile, and it may not do as well outside those specific use cases.” — Nate B Jones, 2025-03-06
Két következmény. Egy: stabilitás — kisebb modellek hajlamosak elveszíteni a gondolat-fonalat, vissza-fordulni saját álláspontjukra, hosszabb kontextusban összeomlani. A QwQ-32B jó arra, amire trenírozták, de általános tudás vagy kreatív feladatokon érezhetően gyengébb. Kettő: a Meta-helyzet — a Llama 4 csúszik, a DeepSeek R2-t bejelentette, a Qwen felülmúl egy korábbi referencia-pontot. Nate kérdése: “Zuck has invested so much in AI but hasn’t shipped lately” — a Meta open-source-pozíciója fokozatosan elcsúszik a kínai labok alatt.
SET / ITLine-szempontból: ha egy enterprise-stack-en specifikus, mérhető feladatra kell modellt választani (SQL-generálás, code-review, dokumentum-extrakció), egy 32B-modell lokális GPU-n elegendő. De a stack úgy épüljön, hogy több modellt támogasson, és feladat-jelleg szerint routeoljon — a specializált kis modell és az általános nagyobb modell párhuzamosan él, nem helyettesíti egymást.
Reflection AI — “ha megoldod a kódolást, megoldottad az AGI-t”
Március 7-én Misha Laskin (CEO) és Ioannis Antonoglou (CTO) kilépnek a stealth-ből a Reflection AI startuppal — 130 millió dolláros összes finanszírozással (Sequoia + CRV seed, Lightspeed + CRV Series A). A team-háttér: Laskin a Gemini reward-modellezését vezette a DeepMindnél, Antonoglou az AlphaGo egyik core-architectje volt.
A Latent Space-interjúban Laskin erős, opinionated keretet ad. Központi tézise: a szuperintelligencia két építőkockából áll össze. Az egyik a reinforcement learning, amivel már most élünk (AlphaGo, AlphaZero), de eddig csak nagyon szűk területeken. A másik a large language model, ami nagyon általános, de a használója vezeti — “language models are like cruise control, helpful everywhere but you’re still driving”. A két ráció egybeolvasztva: általános szuperintelligencia a számítógépen.
A Reflection nyilvánvalóan opinionated abban, honnan kezdjük. Idézet, saját keretben:
“Software engineering is already what I’d call ergonomic for a language model. Code is the prior the model has the most of, because it’s all over the internet. Mouse movement and geospatial reasoning is the prior we humans have. So coding is the only category that’s already ergonomic to what the language model is good at.” — Misha Laskin, 2025-03-07
Ez egy architektúra-állítás: a kódolás nem egy a sok agent-feladat közül, hanem strukturálisan a legkönnyebben verifikálható és a legjobban illeszkedő feladat-tér. A code-output deterministic-en futtatható, tesztelhető, statikus-elemzhető. Ez direkten visszaköszön az Anthropic Building Effective Agents-tézisre: ahol verifier van, ott az agent konvergál; ahol nincs, ott “noise”. A Reflection ezt a logikát a vég-célnak (általános szuperintelligencia) is alapjául teszi: aki megépíti az autonóm coding-rendszert, az platformot szerez mindenre, mert a többi feladat is kód-formában elvégezhetővé válik.
A termék-iránya is konkrét: nem co-pilot, hanem autonóm rendszer. Laskin különbséget tesz: “a co-pilot product like Cursor or GitHub Copilot — the engineer is driving most of the work. We’re building more of the autonomous vehicle: you give it a task and a code base, and it outputs the code that resolves the task.” A target-piac nagy mérnöki csapatok, ahol a backlog-munka (refactor, migráció, security-ticket, infrastruktúra-incidens) automatizálható. A delivery nem IDE-extension, hanem API: bemenet {task, code base}, kimenet a megoldott pull-request.
Két SET-szempontból érdekes pont. Az egyik: a kódolás az AGI első verzió-ja — erre lehet egyetérteni vagy nem, de a kísérlet a következő 12 hónapban mérhető eredményt hoz. A másik: model-customer ko-fejlesztés. Laskin szerint “super intelligence cannot be built in a vacuum — your customers define your evaluations”. Direkt reakció arra, hogy a SWE-bench és a statikus benchmark-ok nem reprodukálják a valódi enterprise-feladatokat. A SET-szellem konvergens: a verifier a feladat-térből jön, nem szintetikusan.
Claude plays Pokémon — agent-harness vékonyabban, mint hinnéd
A Latent Space március 4-i epizódja David Hershey-t hozza el az Anthropictól — ő a “Claude plays Pokémon” projekt szerzője, ami a Claude 3.7 Sonnet-launchhoz kapcsolódóan február végén élesben futott a Twitchen. Hershey 2024 júniusa óta dolgozik a projekten — minden új Claude-verzióval újrafutatja, hogy lássa, hol javul a modell.
A harness lenyűgözően egyszerű. Pár konkrét részlet:
- Három tool: emulator-button-press, knowledge-base read/write, és egy navigator-tool ami koordinátákra ugrik a játéktér-screenshot-ról (mert a modell nem érti jól a 2D-térbeliséget).
- Conversation history: 30 message-rotáció, utána summary, és újraindul. Hershey próbálkozott 20-szal és 40-nel is — 30 a sweet spot ennél a modellnél.
- Token-volumen per turn: 5 ezer és 100 ezer között váltakozik, attól függően, milyen mély a knowledge-base és mennyi screenshot van benne.
- System-prompt: kb. 1000 token — pár tool-leírás, hat tény Pokémonról, és néhány korrekció arra, hogy mit ne csináljon.
A legfontosabb mérnöki tanulság, ami közvetlenül érinti az agent-tervezést:
“Every model that came out, the main change I made to this agent was deleting prompt stuff. As models get better, making it as simple as possible and giving them as much free reign to try to solve a problem is more useful.” — David Hershey, 2025-03-04
Vagyis: az agent-harness ne kódolja be a modell aktuális hibáit. Hershey 8 hónap alatt ennek pontosan a fordítottját tanulta meg — minden Claude-verzióval prompt-tartalmat töröl, mert a régebbi modellek workaround-jai az újabb modelleknek gátját képezik. Ez direkt csengés az Anthropic W07-es tézisére: “if the models get smarter, your moat disappears, you’re building the wrong thing”. A Pokémon-harness empirikus megerősítése ennek.
Másik figyelemre méltó megfigyelés: a 3.7 Sonnet meta-kommentárral egészíti ki a knowledge-base-t — beírja, ha valamit félreértett, és emlékezteti magát a hibára. Ez self-reflective mintázat, ami nincs explicit tréningelve, de hosszú-horizontú feladatban előbukkan. A 2025-ös agent-tervezésnél: a knowledge-base ne csak fact-tár legyen, hanem self-reflective workspace.
Mit viszünk magunkkal
A hét négy mérnöki / IT-vezetői kérdést hagy:
- A voice-modul cserélhető komponensként kezelendő. Enterprise-stack voice-funkciónál (call-center-asszisztens, help-desk, accessibility) érdemes a hang-modellt leválasztani a többi modulról. Sesame, ElevenLabs, OpenAI, Amazon (Polly) különböző sebességgel mozognak; gyors frissítés-ciklus várható. SET-szempontból: a voice-output verifier-rétegen menjen át (intent-check, brand-tone-check), ne egyenest a felhasználóhoz.
- Specializált kis modell + általános nagyobb modell párhuzamosan. A QwQ-32B nem váltja le a Claude-ot vagy a GPT-5-öt, de adott feladat-szegmensben olcsóbban és lokálisan futtatható. Stack-tervezésnél az alapértelmezett kérdés: “melyik feladat-osztályt érdemes specializált kis modellel megoldani, és melyiket hagyni a nagy generalistára?” — és a routing-réteg ezt kapja meg.
- A kódolás-mint-belépő tézis stress-test-je. Ha a Reflection AI tézise igaz (autonóm coding-rendszer ⇒ általános szuperintelligencia), akkor minden enterprise stack-tervezésnél érdemes feltenni: “ha az autonóm coding-agent két év múlva tényleg olyan jó lesz, mint a Reflection ígéri, mi épül erre, és mi omlik össze?” Konkrétan: a saját codebase-megértés, dokumentáció-konformitás, migration-szabályok mennyire vannak már most kód-formában? Ami nincs, az 2027-re technical debt.
- Az agent-harness ne kódolja be a modell aktuális hibáit. A Claude-Pokémon-projekt empirikus tanulsága: minden új modell-verzióval töröld a workaround-okat, ne építsd újra a stack-et a régi modell körül. A mérnöki minta: a prompt és a tool-szerződés modell-verzió-felett legyen — vagyis stabil interfész, és a modell-specifikus rétegek lecserélhető plug-inek.
A W11-ben Manus AI hype várható, és további benchmark-eredmények a QwQ-32B körüli kínai-Frontier-versenyből.
Források
Fő forrás — Nate B Jones csatornája:
- 2025-03-05 · Voice mode: Sesame, Alexa+ and Siri — Sesame uncanny valley, Apple Siri 2027-csúszás, voice-stack-piac.
- 2025-03-06 · Qwen Beats DeepSeek R1 with 20x Smaller Model — Where is Meta? — QwQ-32B “üvegnyíl” metafora, Meta-helyzet.
Körbejárás / tech-mélység — Latent Space podcast:
- 2025-03-04 · How Claude Plays Pokémon was made (David Hershey, Anthropic) — agent-harness, tool-design, prompt-deletion stratégia.
- 2025-03-07 · Solve coding, solve AGI (Misha Laskin, Reflection AI) — autonóm coding-tézis, model-customer ko-fejlesztés, $130M Series A.
Termék-perspektíva — Peter Yang csatornája:
- 2025-03-09 · Inside the Best AI Model for Coding and Writing (Scott White, Anthropic) — Claude 3.7 Sonnet termék-fejlesztési filozófia, Claude Code, eval-mint-CICD.
Fact-check és hivatkozott eredeti források:
- Sesame — Crossing the uncanny valley of conversational voice (research blog)
- Sesame CSM-1B Apache 2.0 release (Hugging Face)
- Qwen blog — QwQ-32B: Embracing the Power of Reinforcement Learning
- VentureBeat — Alibaba’s QwQ-32B matches DeepSeek-R1 with way smaller compute
- SiliconANGLE — Reflection AI launches with $130M funding (2025-03-07)
- Sequoia Capital — Partnering with Reflection: Toward Superintelligence
- TechCrunch — Anthropic’s Claude AI is playing Pokémon on Twitch (2025-02-25)
A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.