Heti AI-hírlevél · ITLine

2025-W09   2025-02-24 — 2025-03-02   ·   11 forrás

W09 — Megérkezett a hibrid-érvelő Claude 3.7 Sonnet, és az Anthropic kiteszi a Claude Code-ot a terminálba

Anthropic Claude 3.7 Sonnet — első hibrid-érvelő frontier-modell, csúszka-API a thinking-budgetre, és Claude Code research preview a terminálba. OpenAI GPT-4.5 (Orion) belép a piacra 25-szörös input-árral, és a hét vége felé az Anthropic részletesen kibontja a constitutional classifiers jailbreak-védelmet.

Kép helye — Bal oldalon egy terminál-ablakban Claude Code-prompt fut egy Next.js repón, jobb oldalon egy ‘thinking budget’ csúszka 0-ról 64K-ig húzva — alatta a Sonnet 3.7 / GPT-4.5 ár-összehasonlítása ($3 vs $75 input, $15 vs $150 output)

Ez a hét kétoldalú modell-launch-hét. Hétfőn, február 24-én az Anthropic kiadja a Claude 3.7 Sonnet-et — az első hibrid-érvelő frontier-modellt, ami egy súlykészletben tartja a gyors választ és a kiterjesztett thinking-módot, és csúszka-API-paraméterrel állítható, mennyi reasoning-budgetet kap egy kérés. Vele egy időben érkezik a Claude Code research preview — terminálba beülő agentic coding tool, ami repón belül dolgozik, teszteket futtat, git-be commit-ol. Csütörtökön, február 27-én megjön a GPT-4.5 (Orion) — a W07-ben emlegetett “utolsó nem-érvelő modell” —, 25-30-szoros input-árral a 4o-hoz képest, csak Pro-tier-en. A Latent Space négy epizódot ad ki agent-infrastruktúráról (Browserbase, Raycast, S1, Gemini 2.0), az Anthropic pedig 75 perces mélyinterjút közöl a constitutional classifiers jailbreak-védelemről. A közös szál: a frontier-modell már nem self-contained termék, hanem stack-réteg, amit a környezet — terminál, böngésző, IDE, classifiers — fog össze használhatóvá.

Claude 3.7 Sonnet — egy modell, két gondolkodási üzemmód

Az Anthropic február 24-i bejelentése tervezésileg a GPT-5-tervezet ellenpárja: pontosan azt az egyesítést szállítja le, amit Altman a W07-es roadmap-posztban ígért. A Sonnet 3.7 standard módban gyors-választ adó chat-modell, extended thinking módban step-by-step reasoning-blokkokat ad ki, amik a felhasználónak láthatóak. A kulcs-újdonság az API-csúszka: a developer tudja állítani, hány tokenig gondolkodjon a modell — egy mérnöki control surface, ami eddig nem létezett kommerciális modellen. Az ár marad a 3.5-ös szinten: $3 / millió input, $15 / millió output, és a TechCrunch megerősíti, hogy a thinking-tokenek is az output-árban vannak — vagyis ha hagyod, hogy a modell hosszan gondolkodjon egy egyszerű query-n, a számla felugrik.

Nate a február 24-i early-access videójában a real-world kódolás-fókuszt emeli ki: “this is the biggest update to building tools that I’ve seen this year”. A 3.7 jobb az intent-inferenciában rövid prompt-ból, mint a 3.5: egylövéses (one-shot) válasz, prezentálható kimenet. Ami architektúra-szempontból érdekes: a 3.7 opinionated a kódolásban. A február 26-i Nate-elemzés szerint ez direkt design-decision, nem benchmark-szempont — “it insists on a particular sort of way of building code”. Aki maleabilis modellt akar, marad a 3.5-en, aki struktúrát kap, gyorsabban szállít. A Challenger-stratégia tisztán látszik: a Claude kódolásra-specializálódik, a ChatGPT a generalista pozíciót védi. A 3.7 a Cursor-be azonnal beérkezik, GitHub-integráció kapcsolódik hozzá, parancssoron pedig a Claude Code lesz az új belépési pont.

Claude Code — a terminál mint elsődleges agent-felület

Az Introducing Claude Code videó (Boris és Cat, Anthropic) 3 perc 54 másodperces demonstratíva. Egy Next.js-app, amit a Claude Code először maga feltérképez, majd egy magas-szintű feature-kérést — “replace the left sidebar with chat history, add a new chat button” — fájl-listák nélkül végrehajt. Mérnöki jelentőségű, ami utána történik: a Claude Code tesztet ír, buildet futtat, buildhibákat javít, újra próbálja, amíg jó nem lesz, végül commit-ol és push-ol GitHub-ra. A teljes ciklus — analyze → edit → test → build → fix → commit → push — egy autonom loop, ami a W07-es Anthropic Building Effective Agents-definíciójának tankönyvi példája: az LLM dönti el, hány lépés kell, és csak akkor áll meg, amikor a verifier (build + teszt-pass) elfogadja.

Két mérnöki kérdés ITLine / SET-stack-szempontból:

  1. A terminál mint elsődleges felület. A Cursor / VSCode-Copilot-vonal IDE-ba beépülő asszisztens; a Claude Code az IDE-t megkerüli, és a parancssorba ül. Másik tervezési kompromisszum: kevesebb UI-context, de tisztább git/CI-integráció és distro-független (bármilyen CI-runner-en futtatható). SET-perspektívából: a “agent a repón belül” mintázat közelebb áll az orchestration-rétegben elhelyezett verifier-hez, mint az IDE-belső copilot-akciók.
  2. Research preview, nem GA. Addig ne építsünk rá business-critical automatizmust, amíg nem stabil — viszont prototípusra azonnal alkalmas, és az ott szerzett tanulság generalizálódik az SET orchestration-rétegre is.

A W07-es Erik-tézist — “if the models get smarter, your moat disappears, you’re building the wrong thing” — a Claude Code kötelességszerűen demonstrálja: nem egy WYSIWYG-IDE, ami a 3.5 hibáit kerülgeti, hanem vékony agent-réteg a modell-erősségre építve, ami okosabb modellel automatikusan jobb lesz.

OpenAI GPT-4.5 (Orion) — drága, érzelmes, és Lego-blokk

Február 27-én megérkezik a GPT-4.5 — a W07-ben emlegetett “utolsó nem-érvelő modell”. A piaci reakció vegyes: a benchmark-számok nem ütik meg a Claude 3.7-et és az o3-mini-t, miközben az ár 15-30-szor magasabb (OpenAI hivatalos pricing): input $75, output $150 / millió token (vs. GPT-4o $2.50 / $10, vs. Sonnet 3.7 $3 / $15). Csak Pro-tier-en ($200/hó) érhető el, később jön Plus-re.

Nate a február 28-i elemzésében a stratégia-narratívát hozza el, nem a benchmark-vereséget: “this is a Lego block play”. Az érv: a ChatGPT piaci vezető (100M+ aktív user), és a piaci vezetőnek mindenre szüksége van a stack-ben, nem csak deep-reasoning-ra. A 4.5 azt fókuszálja, ami a benchmark-eken nincs benne: emotional intelligence, nuanced writing, the ability to surprise you. Ezek kvalitatív szempontok, amik egy GPT-5-szintű egyesített modellben építőelemek. A 4.5 mai magas ára nem termék-ár, hanem R&D-fedezet — a hosszú távú fogadás, hogy ezek a tulajdonságok kompute-csökkentés után beolvaszthatóak.

A frontier-piac tisztul: 2025 Q1 végére három család áll szemben — Anthropic (kódolás-fókuszú, hibrid-érvelő), OpenAI (generalista, Lego-építkező GPT-5-irányba), Google (modell-zoo, Flash + Flash Thinking + Pro-experimental). A február 28-i Logan Kilpatrick-interjúban a Google-stratégia: a Pro-modellek a teacher-modellek, a Flash a distilled production-verzió, az Ultra-tier szándékosan nincs kiadva.

Mellékszál — Browserbase: a böngésző mint AI-infrastruktúra

A Latent Space február 28-i interjúja Paul Klein-nel (Browserbase CEO) a headless browser as a service kategóriát rajzolja meg. Ha 2025-ben az agent-ek a webet automatizálják (Operator, Deep Research, Manus), akkor kell egy infrastruktúra-réteg, ami ezres skálán, alacsony cold-start-tal futtatja a Chromium-példányokat. A Lambda nem elég (Chromium 250 MB+, stateful), Fargate sem (controll-szint hiányzik) — Browserbase saját firecracker-VM-eken pörget pool-okat. Két mérnöki tanulság:

Az auth a következő szűk keresztmetszet, nem a captcha. “I actually think that auth is the biggest thing that will prevent agents from accessing stuff, not captchas.” Klein várása: jönnek az agent-OAuth-protokollok, ahol a humán user explicit jóváhagyással ad limitált scope-ot egy agent-tokenre (“this agent can book Airbnb, but cannot send messages”). Stytch, Clerk és más auth-providerek építik. ITLine / enterprise-szempontból: az AI-agent-deploymentnél az auth-réteget külön kell tervezni, nem feltételezni, hogy a klasszikus user-bejelentkezés elég.

A live view + két-utas kontroll mintázat. A Browserbase iframe-be ágyaz egy headless böngésző-streamet, amibe a humán bele tud nyúlni — 2FA-kód, szokatlan captcha esetén. Ez a human-in-the-loop pause point CDP-protokoll-szintű implementációja. SET orchestration-szempontból: a verifier-réteg mellett a pause_for_human callback explicit komponens kell legyen, nem opcionális.

Mellékszál — Raycast és S1: két irány az agent-rétegen

A február 26-i Latent Space-interjú a Raycast CEO-jával (Thomas Paul Mann) az asztali AI-orchestration-réteget rajzolja meg. A Raycast AI Extensions-rendszert ad ki: TypeScript-funkciók JSDoc-megjegyzésekkel, amiket a Raycast tool-szerződéssé fordít a beépített LLM-jeinek. Két konkrétum: saját fine-tunelt modell (ray-1, GPT-4o-mini-distilled), mert “reasoning models behave very differently and the ones that can do tool calls, we found they have a very different way of using tool calls” — vagyis a tool-calling-fókuszú fine-tune megelőzi a reasoning-erőt ezen a use-case-en. Másrészt saját eval-rendszer, mert “nobody talks about how to do evals with tool calls. It’s a super unsolved thing.” Tool-call-mockok + DSL — ugyanaz a minta, amit SET test-driven verification-ben követünk: a tool-szerződés mellé tesztelhető szerződés is kell.

A február 26-i másik Latent Space-epizód, az S1-paper-elemzés Tim Kellogg-gal a reasoning-modell-redukciós irányt mutatja. A “$6 DeepSeek R1 competitor” S1: kb. 1000 példán fine-tunelt modell, ami reasoning-szerű viselkedést produkál azzal, hogy a generálás során wait / think tokeneket szúr be — egyszerű intervenció, az inference-time-scaling graf hasonló az o1-éhez. Az érdekesebb megfigyelés: az entropix-megközelítés (a model belső entrópiáját figyelve dönteni a sampling-paraméterekről) valószínűleg helyesebb irány, mint a hossz-alapú beavatkozás. Kellogg keretezi: “if you can do that at runtime, you should be able to train the model to do that on its own.” Ez kulcs lehet a doom-loop-problémához (agentek beragadnak körkörös trajektóriákba) — a model saját bizonytalansági szignáljának RL-rétegbe-építése.

Apróbb hírek a hétről

Mit viszünk magunkkal

A hét három mérnöki / IT-vezetői kérdést hagy ott:

  1. A “thinking budget” mint API-paraméter — kontroll vagy költségkockázat? A Claude 3.7 Sonnet csúszka-API-ja fontos mérnöki control surface, de azonnal felveti: ki dönti el, mennyit gondolkodjon a model? SET / orchestration-szempontból a thinking-budget-et task-osztály-szerint érdemes előre rögzíteni (egyszerű query → 0, code-edit → közepes, complex refactor → magas), és loggolni, mennyi reasoning-tokent fogyasztott egy feladat. Aki ad-hoc engedi, hogy a model döntsön, a számlán fogja meglátni a következményt.
  2. A Claude Code mint vendor-független tervezési minta. A terminál → repó → autonomous loop → commit mintázat le-építhető Cursor + custom-CLI-vel vagy SET-stack-ben gate-pipeline-nal is. Aki most agentic-coding-t tervez, érdemes a Claude Code-keretben gondolkodnia: mi a verifier (build + teszt), mi a fail-case (automatikus rollback), mi a human-pause-point (push előtt review). Ez 2025 Q2-jének de facto blueprint-jévé válik.
  3. Az auth-réteg explicit tervezése AI-agent-deployment-nél. Klein tézise — “auth, not captcha, is the bottleneck” — direkt alkalmazandó: ha agent-deploymentet tervezünk (akár belső, akár ügyfél-rendszerekre), az auth-flow-t az architektúra első szintjén kell tisztázni. Konkrétan: a klasszikus SSO mellett külön agent-token-osztály korlátozott scope-pal és lerövidített élettartammal, és a humán-jóváhagyási flow (push-notification okos-eszközre) az MVP-be építve — nem post-mortem javítva.

A W10-ben várhatóak: az Anthropic Sonnet 3.7 első production-feedback-jei, a GPT-4.5 Plus-tier-rollout, és új open-source agent-framework-launch-ok.

Források

Fő forrás — Nate B Jones csatornája:

Primer forrás — Anthropic hivatalos:

Körbejárás / tech-mélység — Latent Space podcast:

Egyéb / product-perspective — Peter Yang:

Fact-check és hivatkozott eredeti források:


A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.