A hét kettős keretben ér véget. Egyfelől az Apple kutatóinak Illusion of Thinking paperje pár nap alatt mémmé válik — futótűzként terjed a “lám, az AI hülye / nem érvel / Apple bebizonyította a végét” narratíva. Nate B Jones június 9-én megpróbálja a paper tényleges állítását rekonstruálni, és kihúz egy hasznos rendszerszervezési tanulságot az “amikor a modell elakad, hívjon segítséget” mintázatáról. Másfelől ugyanezen a héten az OpenAI június 10-én bejelenti az o3-Pro-t és 80%-kal levágja az o3 árát, Sam Altman publikálja a Gentle Singularity-esszét, a Cursor-csapat Anthropic-podcastjében a verifikációt nevezi meg következő szűk keresztmetszetként, Chris Lattner pedig a Latent Space-en a Mojo / Modular-stack szerepéről beszél a CUDA-monopólium felbontásában.
A közös szál: a “thinking-models törékenyek” mikrobenchmark-vita ugyanabban a héten zajlik a “modellek racionálisan tudnak megállni / segítséget kérni / olcsóbban lefutni” termékhullámmal. A használható AI-rendszer az, ami tudja, mikor nem tud döntést hozni.
Az Apple-paper, a meme-háború és a “call for help”-tanulság
Az Apple kutatócsoport (The Illusion of Thinking) kontrollált puzzle-környezetekben (Tower of Hanoi, river-crossing, checker-jumping) tesztelte a reasoning-modelleket — Claude, Gemini, DeepSeek, OpenAI o3-mini —, tool-használat és internet nélkül. Három tartományt találtak:
- Alacsony komplexitás: a sima (nem-thinking) modellek néha jobbak (a thinking-tokenek “felülgondolkodnak”).
- Közepes komplexitás: a reasoning-modellek érdemben jobbak.
- Magas komplexitás: mindkettő összeomlik — és a thinking-erőfeszítés is csökken, pedig lenne token-budget. A modellek mintha “feladnák” (a paper counter-intuitive scaling limit-nek hívja).
A net ebből a 3. pontból csinált mémet: “AI is fake. Apple proved reasoning wrong.” Nate (június 9-i videó) védi a kutatókat — a paper visszafogottabban fogalmaz, mint a róla szóló social-media-cunami. És két korlátot kiemel:
- A modellek nem kaptak eszközt. Sem Python, sem web-search. Olyan, mint embert papírtól-tolltól-számológéptől megfosztva tesztelni. Tool-os környezetben a modellek simán megoldják.
- Csak a state-of-chain-of-thought-ot mérték — pontosan azt, amiről 2024 vége óta tudjuk, hogy csak lazán korrelál a modell tényleges belső reprezentációjával. A frontier-modellek (o3 full, Gemini 2.5 Pro) hiányoznak a tesztből.
Eddig a fact-check. Ami viszont valódi tanulság: a magas-komplexitásnál van egy “cliff”, amikor a modell értelmes választ nem tud generálni — és sem a modell, sem a hívó nem tudja, hogy itt vagyunk. Nate konkrét javaslata: “LLMs don’t have a super standard, understood framework for calling for help when they run into difficult situations.”
Vagyis: kellene egy iparági konvenció a ‘call for help’-mintára — amikor a kis/olcsó/gyors modell felismeri, hogy a problémája meghaladja, és átadja egy nagyobb / tool-os / inference-time-os modellnek (vagy embernek). A Who Wants to Be a Millionaire-féle “lifeline”. Olyan termékterületeken, ahol nem engedhetünk meg 90 másodperces think-time-ot (call-center-bot, fraud-detection), a kis modell 98%-ot megold, és 2%-ban átkéri a feladatot a nagyhoz — de ehhez explicit trigger-protokoll kell.
A SET-keretben ez a verifier-tézis kiterjesztése: a “call for help” éppen az a pont, ahol az olcsó verifier (confidence-score, complexity-heurisztika) eldönti, hogy a modell-output kiadható, vagy magasabb szintű szereplőhöz kell mennie. A “tudja-e a modell, hogy nem tudja” probléma kommercializálható guard-rail, és az iparág 2025 második felére itt fog konvergálni.
OpenAI: o3-Pro és 80%-os árvágás az o3-on
Június 10-én az OpenAI hivatalos posztja két dolgot jelent be:
- o3 árvágás 80%-kal: input $2 / 1M token, output $8 / 1M token (a korábbi $10 / $40-ról). Ugyanaz a modell, csak az inference-stack-et optimalizálták.
- o3-Pro elérhetővé vált API-ban (Pro és Team-tier-ben), és több inference-time compute-ot kap, mint az alap o3.
Nate június 11-i első benyomásokat gyűjtő videójának három állítása érdemes:
- Az o3-Pro nem feltétlenül hosszabb választ ad — sokszor rövidebb, mint az o3, mégis használhatóbb. Felismeri, mikor nem tudja megoldani a feladatot. Anekdota: Twitter-mention-elemzésnél a modell kimondja, hogy a tool-call-jain keresztül nem fér hozzá a kért retweet-szűrőhöz, ezért nem ad táblázatot. Az alap o3 ehhez képest konfabulál egy plauzíbilis, de valós referencia nélküli táblát. Ez direkten az Apple-paper “call for help”-tanulsága.
- Context-éhes modell. Light-context-en rosszul fut — egy egyszerű “summarize this PDF”-feladatot túlgondol és pluszadatot húz be a webről. Nate analógiája: “Like driving a Ferrari to the grocery store.”
- Új típusú post-publication-fact-check kötelezettség. Az o3-Pro annyira meggyőző prózát ír, hogy a benne lévő kitalált számok nem szúrnak szemet emberi olvasásra. Nate konklúziója: “It is probably going to end up being malpractice not to check the model’s response with another model before publication.”
Az árváltozás iparági olvasata: az inference-piac konszolidálódik. A 80%-os vágás után az o3 ár közel kerül a Gemini 2.5 Pro / Claude Sonnet sávhoz — a ‘frontier reasoning’ már nem prémium-kategória, alap-tier lett. Ez konzisztens a W22-ben tárgyalt verseny-dinamikával.
Sam Altman: Gentle Singularity — a hét másik narratívája
Ugyanazon a napon, mint az o3-árváltás, Altman publikálja a The Gentle Singularity-esszét. A keret: 2025 AI-agentek érdemi kognitív munkán; 2026 “novel-insight”-rendszerek; 2027 hasznos robotok; 2030-as évek “wildly abundant” intelligencia és energia.
Altman a gentle-jelzővel egy AI-anxious nyilvánosságnak üzen: a singularity nem katasztrofális, hanem inkrementális — “wonders become routine”. Stratégiailag ez direkt válasz a Dario Amodei-féle “white-collar bloodbath”-keretre, amit a W22-ben bontottunk ki. Amodei a szabályozói nyomást keresi, Altman a piaci bizalmat — nem ugyanazt a társadalmi narratívát viszik. A paper-narratíva és a Gentle Singularity kettőse figyelmeztet: ne csináljunk reflex-narratívát egyik irányba sem. SET-szempontból a rendezőelv ugyanaz: a verifier-réteg, a guard-rail és a “tudja, mikor nem tudja”-mintázat dollármilliárdos technical-debt-rendezés 2025-2026-ban — függetlenül attól, hogy a modellek mennyire gyorsan jutnak el “novel insight”-ig.
Cursor az Anthropic-podcastben — a verifikáció a következő bottleneck
Az Anthropic június 10-én publikálja a Cursor-csapatot bemutató podcastet (Lucas Pickering, Aman Sanger, Jacob Jackson). A Cursor ekkor 300 millió dolláros ARR-en jár, milliós felhasználói bázissal. Három pont érdemes egy IT-vezetőnek:
A használat-spektrum a billentyűleütéstől a háttér-agensig. Tab (autocomplete) → Cmd-K (régió-edit) → foreground agent (több fájl) → background agent (egész PR-ek autonóm végrehajtása, virtuális gépben, dependency-stackel és teszt-futtatással). Most adták ki preview-ban. Aman: “It’s not at 100%, and it’ll take a while to get there. So you parallelize them.” A modell 90%-ig odaér, a maradék 10% emberi átvétel — a foreground-háttér átmenet gyors és kétirányú kell legyen.
Verifikáció = következő bottleneck. Aman számszerűsít: ha a fejlesztő idejéből 70% kódírás, 30% review, és a kódírást teljesen megoldja az AI, akkor is csak 3x gyorsulás jön. A nagy ugrás a review felgyorsításában van. Egy javaslat: alternatív kódbázis-reprezentációk (pszeudokód-szintű diff, ami koncízen áttekinthető, de map-pel a tényleges kódra). A vibe coding azért működik kis projektre, mert a verifikáció triviális (megnyitod, kipróbálod) — production-codebase-en az infra-felépítés a kihívás: dependency-set, test-runner, mock-réteg, hogy a háttér-agent egyáltalán tudjon teszteket futtatni. A Cursor itt snapshot-elhető fejlesztői környezetekkel dolgozik.
Kódbázis-megértés és “the right way”. Még ha az agent át is futtatja a tesztet, az nem jelenti, hogy jól írt kódot tett le. Lucas: “I could write a debounce function from scratch and just use that and that would make the test pass. But that’s not the right way to do it.” A “the right way” gyakran nem a kódban él, hanem Slack-üzenetekben, korábbi PR-megbeszélésekben. Aman becsülése: ha a code-base-ismeretet tökéletesre megoldják, az 5-10x produktivitás, de ennél tovább csak akkor jutnak, ha a szervezeti tudás-rétegek bekerülnek a stack-be.
A csapat üzenete tiszta: a mainstream IDE-AI 2025-ben a kódírás-szakaszt elintézte, és a verseny most a verifier-rétegre, a snapshot-környezetekre és a kódbázis-aware retrieval-ra költözik.
Mellékszál — rovatok
Chris Lattner és a Modular — CUDA-replacement, amit komolyan vesznek. A Latent Space Shape of Compute-epizódjában (június 13.) Lattner három évnyi rejtett R&D után most megnyitja a Modular stack-et: Mojo (Python-szintaxisú nyelv, GPU-ra is fordít), Max (gen-AI inference-framework), cluster-szintű deployment. Cél: az NVIDIA-CUDA monopólium felbontása, AMD MI300/355 és Blackwell támogatás. A Mojo-konténer ~1 GB-os (VLM-stack-hez képest töredék), és a Max framework NVIDIA + CPU-n ingyenes. Ez a SET on-prem-versus-cloud-keretünkkel is összecseng — a hardver-választás függetlenedjen a fejlesztett alkalmazás logikájától.
OpenAI Connectors és Record Mode. Peter Yang június 15-én publikál interjút Nate Gonzalez-szel (OpenAI head-of-business-products). Két új feature: Connectors (Google Drive, SharePoint, Box, Dropbox direkt integráció ChatGPT-be, jogosultság-tisztelő retrieval) és Record Mode (meeting-transcript + idő-stamped action-items). Az iparági kontextus: az OpenAI nem csak modell-eladó, hanem enterprise-knowledge-platform. Üzenet IT-vezetőknek: a Fortune 500 92%-a ChatGPT Enterprise-on van — ha már most nincs internális tiltó-policy a Connectors-feature-re, a magán-céges adat lassan beszivárog OpenAI-back-endbe.
AI Diplomacy — a benchmark mint élő kísérlet. Alex Duffy (Every) elindít egy LLM-vs-LLM Diplomacy-benchmarkot Twitch-streammel. Eddigi mintázat: Claude túl kedves (nem fog nyerni), o3 megtéveszti a többieket (a saját diary-ban: “They fell for it hook line and sinker”), DeepSeek roleplay-szerűen agresszív. A benchmark-ötlet alkalmazkodó: minél jobbak a modellek, annál mélyebb a kihívás.
Anthropic AI Fluency Framework. Az Anthropic június 12-én kiadja a 11-leckés ingyenes AI-fluency-tananyagot — Delegation, Description, Discernment, Diligence (“4D framework”). Általános fehérgalléros közönségnek szól. Releváns IT-vezetőnek: belső training-content erre alapozhat, nem kell saját tananyagot az alapokra kifejleszteni — a SetCode-szintű anyag a producer-szintű, tooling-natív rétegre fókuszálhat.
Mit viszünk magunkkal
A hét három operatív kérdést hagy ott:
- “Tudja-e a modell, hogy nem tudja?”-tervezés. Az Apple-paper és az o3-Pro-launch ugyanazt a problémát mutatja két oldalról. SET-stack-ben konkrét guard-rail-pattern: minden agent-kimenet mellett explicit confidence / scope-check / refuse-or-escalate döntés. “This is outside my tool’s reach” mint termék-funkció, nem hibaeset. Érdemes most berakni a saját stack-be, mielőtt egyik vendor szabványosítja.
- Verifier-réteg mint fizetős termék. A Cursor kimondja, amit a W07-ben az Anthropic Erik-je és W22-ben a Factory-csapat is kiemelt: a kódírás-gyorsulás csak akkor 5-10x, ha a verifikáció is gyorsul. Aki snapshot-environment + automated-test-loop + multi-model-cross-check-kel megoldja, versenyképes — aki nem, commodity AI-licensz-eladó.
- “Modell-keresztellenőrzés” mint új workflow-norma. Nate o3-Pro-megjegyzése (“malpractice not to check”) nem hype — minél meggyőzőbb prózát ír a modell, annál drágább a hibás faktum-átvétel. Production-AI-output mellé belső review-pipeline szükséges (egyszerűbb modell, fact-check API, vagy ember). Ez konkrét cost-line, és az idő-skála pár hónap, nem évek.
A W25-ben Apple WWDC follow-up várható, és további ár-mozgások — a “frontier reasoning olcsó” trend a következő hetekben becsapja a teljes inference-piacot.
Források
Fő forrás — Nate B Jones csatornája:
- 2025-06-09 · Let’s Talk THAT Apple AI Paper — az Illusion of Thinking meme-háború visszafogása, “call for help”-mintázat.
- 2025-06-10 · Most of Us Are Using AI Backwards — kontextus-tervezés és prompt-stratégia.
- 2025-06-11 · o3 Pro is Out — Here’s Everything You Need to Know — o3-Pro első tesztek, “context-éhes”, “modell-keresztellenőrzés malpractice”-tézis.
- 2025-06-13 · The Data Scarcity Myth — adatszűkület-narratíva újragondolása.
Primer forrás — Anthropic hivatalos:
- 2025-06-10 · How Cursor is Building the Future of AI Coding with Claude — Lucas Pickering, Aman Sanger, Jacob Jackson — verifier-bottleneck, background-agent, kódbázis-aware retrieval.
- 2025-06-12 · AI Fluency Framework — Foundations Course — 11 leckés ingyenes tananyag, 4D framework.
Körbejárás / tech-mélység — Latent Space podcast:
- 2025-06-13 · The Shape of Compute — Chris Lattner of Modular — Mojo, Max, CUDA-replacement, vendor-agnoszticitás.
- 2025-06-11 · Launching AI Diplomacy — Alex Duffy, LLM-vs-LLM-benchmark, “benchmarks as memes”.
- 2025-06-10 · Quadratic — The AI Spreadsheet — adatelemzés-AI integráció.
Egyéb — Peter Yang:
- 2025-06-15 · How OpenAI’s Head of Business Products Uses ChatGPT — Nate Gonzalez (OpenAI), Connectors, Record Mode, enterprise-deployment-mintázatok.
Fact-check és hivatkozott eredeti források:
- Apple ML Research — The Illusion of Thinking
- arXiv — The Illusion of Thinking (2506.06941)
- Simon Willison — Seven Replies to the Viral Apple Reasoning Paper
- OpenAI Developers X-poszt — o3 80% áresés és o3-Pro launch (2025-06-10)
- VentureBeat — OpenAI announces 80% price drop for o3
- Sam Altman — The Gentle Singularity (2025-06-10)
- Anthropic — Tracing the Thoughts of a Large Language Model
A heti hírlevelet saját gondolatainkból és független keresésekből állítjuk össze. Az eredeti források a fenti listában találhatók.