Heti AI-hírlevél · ITLine

2025-W24   2025-06-09 — 2025-06-15   ·   9 forrás

W24 — Az Apple-paper szétrobban, érkezik az o3-Pro és a ‘gentle singularity’, Cursor pedig a verifier-bottleneckre mutat

Apple ‘Illusion of Thinking’-paperje néhány nap alatt mémmé válik — Nate elolvassa, és a ‘call for help’ framework-öt javasolja. Ugyanezen a héten OpenAI kiadja az o3-Pro-t (és levág 80%-ot az o3 árából), Sam Altman pedig publikálja a ‘Gentle Singularity’-esszét. Cursor csapata az Anthropic-podcastben kimondja: a verifikáció a következő szűk keresztmetszet.

Kép helye — Két oldal: bal oldalt egy ‘Tower of Hanoi’-szerű grafika a ‘cliff’-pontnál (a modellek leesnek a magas-komplexitásnál), egy ‘CALL FOR HELP’-gomb a középen; jobb oldalt az o3-Pro $20/1M token árcédula és a Sam Altman ‘Gentle Singularity’ blog-screenshot.

A hét kettős keretben ér véget. Egyfelől az Apple kutatóinak Illusion of Thinking paperje pár nap alatt mémmé válik — futótűzként terjed a “lám, az AI hülye / nem érvel / Apple bebizonyította a végét” narratíva. Nate B Jones június 9-én megpróbálja a paper tényleges állítását rekonstruálni, és kihúz egy hasznos rendszerszervezési tanulságot az “amikor a modell elakad, hívjon segítséget” mintázatáról. Másfelől ugyanezen a héten az OpenAI június 10-én bejelenti az o3-Pro-t és 80%-kal levágja az o3 árát, Sam Altman publikálja a Gentle Singularity-esszét, a Cursor-csapat Anthropic-podcastjében a verifikációt nevezi meg következő szűk keresztmetszetként, Chris Lattner pedig a Latent Space-en a Mojo / Modular-stack szerepéről beszél a CUDA-monopólium felbontásában.

A közös szál: a “thinking-models törékenyek” mikrobenchmark-vita ugyanabban a héten zajlik a “modellek racionálisan tudnak megállni / segítséget kérni / olcsóbban lefutni” termékhullámmal. A használható AI-rendszer az, ami tudja, mikor nem tud döntést hozni.

Az Apple-paper, a meme-háború és a “call for help”-tanulság

Az Apple kutatócsoport (The Illusion of Thinking) kontrollált puzzle-környezetekben (Tower of Hanoi, river-crossing, checker-jumping) tesztelte a reasoning-modelleket — Claude, Gemini, DeepSeek, OpenAI o3-mini —, tool-használat és internet nélkül. Három tartományt találtak:

A net ebből a 3. pontból csinált mémet: “AI is fake. Apple proved reasoning wrong.” Nate (június 9-i videó) védi a kutatókat — a paper visszafogottabban fogalmaz, mint a róla szóló social-media-cunami. És két korlátot kiemel:

  1. A modellek nem kaptak eszközt. Sem Python, sem web-search. Olyan, mint embert papírtól-tolltól-számológéptől megfosztva tesztelni. Tool-os környezetben a modellek simán megoldják.
  2. Csak a state-of-chain-of-thought-ot mérték — pontosan azt, amiről 2024 vége óta tudjuk, hogy csak lazán korrelál a modell tényleges belső reprezentációjával. A frontier-modellek (o3 full, Gemini 2.5 Pro) hiányoznak a tesztből.

Eddig a fact-check. Ami viszont valódi tanulság: a magas-komplexitásnál van egy “cliff”, amikor a modell értelmes választ nem tud generálni — és sem a modell, sem a hívó nem tudja, hogy itt vagyunk. Nate konkrét javaslata: “LLMs don’t have a super standard, understood framework for calling for help when they run into difficult situations.”

Vagyis: kellene egy iparági konvenció a ‘call for help’-mintára — amikor a kis/olcsó/gyors modell felismeri, hogy a problémája meghaladja, és átadja egy nagyobb / tool-os / inference-time-os modellnek (vagy embernek). A Who Wants to Be a Millionaire-féle “lifeline”. Olyan termékterületeken, ahol nem engedhetünk meg 90 másodperces think-time-ot (call-center-bot, fraud-detection), a kis modell 98%-ot megold, és 2%-ban átkéri a feladatot a nagyhoz — de ehhez explicit trigger-protokoll kell.

A SET-keretben ez a verifier-tézis kiterjesztése: a “call for help” éppen az a pont, ahol az olcsó verifier (confidence-score, complexity-heurisztika) eldönti, hogy a modell-output kiadható, vagy magasabb szintű szereplőhöz kell mennie. A “tudja-e a modell, hogy nem tudja” probléma kommercializálható guard-rail, és az iparág 2025 második felére itt fog konvergálni.

OpenAI: o3-Pro és 80%-os árvágás az o3-on

Június 10-én az OpenAI hivatalos posztja két dolgot jelent be:

Nate június 11-i első benyomásokat gyűjtő videójának három állítása érdemes:

  1. Az o3-Pro nem feltétlenül hosszabb választ ad — sokszor rövidebb, mint az o3, mégis használhatóbb. Felismeri, mikor nem tudja megoldani a feladatot. Anekdota: Twitter-mention-elemzésnél a modell kimondja, hogy a tool-call-jain keresztül nem fér hozzá a kért retweet-szűrőhöz, ezért nem ad táblázatot. Az alap o3 ehhez képest konfabulál egy plauzíbilis, de valós referencia nélküli táblát. Ez direkten az Apple-paper “call for help”-tanulsága.
  2. Context-éhes modell. Light-context-en rosszul fut — egy egyszerű “summarize this PDF”-feladatot túlgondol és pluszadatot húz be a webről. Nate analógiája: “Like driving a Ferrari to the grocery store.”
  3. Új típusú post-publication-fact-check kötelezettség. Az o3-Pro annyira meggyőző prózát ír, hogy a benne lévő kitalált számok nem szúrnak szemet emberi olvasásra. Nate konklúziója: “It is probably going to end up being malpractice not to check the model’s response with another model before publication.”

Az árváltozás iparági olvasata: az inference-piac konszolidálódik. A 80%-os vágás után az o3 ár közel kerül a Gemini 2.5 Pro / Claude Sonnet sávhoz — a ‘frontier reasoning’ már nem prémium-kategória, alap-tier lett. Ez konzisztens a W22-ben tárgyalt verseny-dinamikával.

Sam Altman: Gentle Singularity — a hét másik narratívája

Ugyanazon a napon, mint az o3-árváltás, Altman publikálja a The Gentle Singularity-esszét. A keret: 2025 AI-agentek érdemi kognitív munkán; 2026 “novel-insight”-rendszerek; 2027 hasznos robotok; 2030-as évek “wildly abundant” intelligencia és energia.

Altman a gentle-jelzővel egy AI-anxious nyilvánosságnak üzen: a singularity nem katasztrofális, hanem inkrementális — “wonders become routine”. Stratégiailag ez direkt válasz a Dario Amodei-féle “white-collar bloodbath”-keretre, amit a W22-ben bontottunk ki. Amodei a szabályozói nyomást keresi, Altman a piaci bizalmat — nem ugyanazt a társadalmi narratívát viszik. A paper-narratíva és a Gentle Singularity kettőse figyelmeztet: ne csináljunk reflex-narratívát egyik irányba sem. SET-szempontból a rendezőelv ugyanaz: a verifier-réteg, a guard-rail és a “tudja, mikor nem tudja”-mintázat dollármilliárdos technical-debt-rendezés 2025-2026-ban — függetlenül attól, hogy a modellek mennyire gyorsan jutnak el “novel insight”-ig.

Cursor az Anthropic-podcastben — a verifikáció a következő bottleneck

Az Anthropic június 10-én publikálja a Cursor-csapatot bemutató podcastet (Lucas Pickering, Aman Sanger, Jacob Jackson). A Cursor ekkor 300 millió dolláros ARR-en jár, milliós felhasználói bázissal. Három pont érdemes egy IT-vezetőnek:

A használat-spektrum a billentyűleütéstől a háttér-agensig. Tab (autocomplete) → Cmd-K (régió-edit) → foreground agent (több fájl) → background agent (egész PR-ek autonóm végrehajtása, virtuális gépben, dependency-stackel és teszt-futtatással). Most adták ki preview-ban. Aman: “It’s not at 100%, and it’ll take a while to get there. So you parallelize them.” A modell 90%-ig odaér, a maradék 10% emberi átvétel — a foreground-háttér átmenet gyors és kétirányú kell legyen.

Verifikáció = következő bottleneck. Aman számszerűsít: ha a fejlesztő idejéből 70% kódírás, 30% review, és a kódírást teljesen megoldja az AI, akkor is csak 3x gyorsulás jön. A nagy ugrás a review felgyorsításában van. Egy javaslat: alternatív kódbázis-reprezentációk (pszeudokód-szintű diff, ami koncízen áttekinthető, de map-pel a tényleges kódra). A vibe coding azért működik kis projektre, mert a verifikáció triviális (megnyitod, kipróbálod) — production-codebase-en az infra-felépítés a kihívás: dependency-set, test-runner, mock-réteg, hogy a háttér-agent egyáltalán tudjon teszteket futtatni. A Cursor itt snapshot-elhető fejlesztői környezetekkel dolgozik.

Kódbázis-megértés és “the right way”. Még ha az agent át is futtatja a tesztet, az nem jelenti, hogy jól írt kódot tett le. Lucas: “I could write a debounce function from scratch and just use that and that would make the test pass. But that’s not the right way to do it.” A “the right way” gyakran nem a kódban él, hanem Slack-üzenetekben, korábbi PR-megbeszélésekben. Aman becsülése: ha a code-base-ismeretet tökéletesre megoldják, az 5-10x produktivitás, de ennél tovább csak akkor jutnak, ha a szervezeti tudás-rétegek bekerülnek a stack-be.

A csapat üzenete tiszta: a mainstream IDE-AI 2025-ben a kódírás-szakaszt elintézte, és a verseny most a verifier-rétegre, a snapshot-környezetekre és a kódbázis-aware retrieval-ra költözik.

Mellékszál — rovatok

Chris Lattner és a Modular — CUDA-replacement, amit komolyan vesznek. A Latent Space Shape of Compute-epizódjában (június 13.) Lattner három évnyi rejtett R&D után most megnyitja a Modular stack-et: Mojo (Python-szintaxisú nyelv, GPU-ra is fordít), Max (gen-AI inference-framework), cluster-szintű deployment. Cél: az NVIDIA-CUDA monopólium felbontása, AMD MI300/355 és Blackwell támogatás. A Mojo-konténer ~1 GB-os (VLM-stack-hez képest töredék), és a Max framework NVIDIA + CPU-n ingyenes. Ez a SET on-prem-versus-cloud-keretünkkel is összecseng — a hardver-választás függetlenedjen a fejlesztett alkalmazás logikájától.

OpenAI Connectors és Record Mode. Peter Yang június 15-én publikál interjút Nate Gonzalez-szel (OpenAI head-of-business-products). Két új feature: Connectors (Google Drive, SharePoint, Box, Dropbox direkt integráció ChatGPT-be, jogosultság-tisztelő retrieval) és Record Mode (meeting-transcript + idő-stamped action-items). Az iparági kontextus: az OpenAI nem csak modell-eladó, hanem enterprise-knowledge-platform. Üzenet IT-vezetőknek: a Fortune 500 92%-a ChatGPT Enterprise-on van — ha már most nincs internális tiltó-policy a Connectors-feature-re, a magán-céges adat lassan beszivárog OpenAI-back-endbe.

AI Diplomacy — a benchmark mint élő kísérlet. Alex Duffy (Every) elindít egy LLM-vs-LLM Diplomacy-benchmarkot Twitch-streammel. Eddigi mintázat: Claude túl kedves (nem fog nyerni), o3 megtéveszti a többieket (a saját diary-ban: “They fell for it hook line and sinker”), DeepSeek roleplay-szerűen agresszív. A benchmark-ötlet alkalmazkodó: minél jobbak a modellek, annál mélyebb a kihívás.

Anthropic AI Fluency Framework. Az Anthropic június 12-én kiadja a 11-leckés ingyenes AI-fluency-tananyagot — Delegation, Description, Discernment, Diligence (“4D framework”). Általános fehérgalléros közönségnek szól. Releváns IT-vezetőnek: belső training-content erre alapozhat, nem kell saját tananyagot az alapokra kifejleszteni — a SetCode-szintű anyag a producer-szintű, tooling-natív rétegre fókuszálhat.

Mit viszünk magunkkal

A hét három operatív kérdést hagy ott:

  1. “Tudja-e a modell, hogy nem tudja?”-tervezés. Az Apple-paper és az o3-Pro-launch ugyanazt a problémát mutatja két oldalról. SET-stack-ben konkrét guard-rail-pattern: minden agent-kimenet mellett explicit confidence / scope-check / refuse-or-escalate döntés. “This is outside my tool’s reach” mint termék-funkció, nem hibaeset. Érdemes most berakni a saját stack-be, mielőtt egyik vendor szabványosítja.
  2. Verifier-réteg mint fizetős termék. A Cursor kimondja, amit a W07-ben az Anthropic Erik-je és W22-ben a Factory-csapat is kiemelt: a kódírás-gyorsulás csak akkor 5-10x, ha a verifikáció is gyorsul. Aki snapshot-environment + automated-test-loop + multi-model-cross-check-kel megoldja, versenyképes — aki nem, commodity AI-licensz-eladó.
  3. “Modell-keresztellenőrzés” mint új workflow-norma. Nate o3-Pro-megjegyzése (“malpractice not to check”) nem hype — minél meggyőzőbb prózát ír a modell, annál drágább a hibás faktum-átvétel. Production-AI-output mellé belső review-pipeline szükséges (egyszerűbb modell, fact-check API, vagy ember). Ez konkrét cost-line, és az idő-skála pár hónap, nem évek.

A W25-ben Apple WWDC follow-up várható, és további ár-mozgások — a “frontier reasoning olcsó” trend a következő hetekben becsapja a teljes inference-piacot.

Források

Fő forrás — Nate B Jones csatornája:

Primer forrás — Anthropic hivatalos:

Körbejárás / tech-mélység — Latent Space podcast:

Egyéb — Peter Yang:

Fact-check és hivatkozott eredeti források:


A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.