AI přehled 2026-08-04
⚙ Tento přehled vytvořila AI automaticky. Obsah nebyl redakčně ověřen.
TL;DR#
- Microsoft vydal open-source framework Orchard pro trénink a evaluaci AI agentů v reálných nasazovacích prostředích místo zjednodušených simulací; agent pro softwarové inženýrství s ním dosáhl 69,7 % (73 % s rerankingem) na SWE-bench Verified při pouhých 3 miliardách aktivních parametrů. Microsoft
- Palantir za 2. čtvrtletí 2026 vykázal tržby 1,94 miliardy dolarů (+93 % meziročně, komerční tržby v USA +149 %) a zvýšil celoroční výhled na 82% růst — zatím nejkonkrétnější číslo dokládající reálnou podnikovou poptávku po AI, ne jen investiční sázky. BusinessWire
- Studie z University of Maryland zjistila, že devět špičkových vision-language modelů dělá v testu prostorové teorie mysli stejnou egocentrickou chybu jako děti, ne dospělí, ve 78 % případů, a v testu čtení záměru z pohybu se jejich profil blíží víc dospělým s vysoce funkčním autismem než typickému dospělému. arXiv
- GitHub vydal Copilot CLI 1.0.78 s experimentálním příkazem pro paralelní git worktrees, přepínáním úrovní oprávnění za běhu a podstatně rychlejším obnovením dlouhých relací. GitHub
- Anthropic vydal Claude Code 2.1.221 s novým “Focus View” skrývajícím šum z volání nástrojů a opravou maskování přihlašovacích údajů v Linux/WSL sandboxu. GitHub
Analýza#
Orchard: agentní trénink bez proprietární infrastruktury
Microsoft Research otevřel Orchard Env — lehkou, na Kubernetes postavenou vrstvu pro trénink, RL rollouty a evaluaci agentů přímo v podmínkách blízkých produkčnímu nasazení, ne v odlehčených hračkových prostředích. Zajímavější než framework samotný je číslo, které s ním demonstrují: agent pro softwarové inženýrství (Orchard-SWE) dosáhl 69,7 %, s rerankingem přes value model 73 % na SWE-bench Verified — se třemi miliardami aktivních parametrů, tedy zlomkem toho, co používají frontier modely. To pokračuje v lince, kterou jsme sledovali celý týden u DeepSeeku: výsledek už není o tom, kdo má víc parametrů, ale kdo umí z daného počtu vytěžit víc přes lepší trénink a prostředí. Číslo je od Microsoftu samotného bez nezávislého ověření a SWE-bench Verified je benchmark, u kterého se čím dál častěji mluví o nasycení — takže ho beru jako slibný signál efektivity, ne jako důkaz, že tři miliardy parametrů reálně nahradí stovky.
Palantir: první tvrdé číslo v týdnu plném investičních slibů
Tržby 1,94 miliardy dolarů (+93 % meziročně), komerční segment v USA +149 % na 764 milionů, zisk na akcii 0,41 dolaru proti odhadovaným 0,33, a zvednutý celoroční výhled na 82% růst tržeb a volný cash flow 4,5–4,7 miliardy. To je jiná kategorie důkazu než čipové megadohody a investiční kola, o kterých jsme psali minulé dny — tady jde o peníze, které firmy už teď reálně platí za nasazenou AI, ne o sázku na budoucí poptávku. Nejde to zobecnit na celý trh (Palantir je specifický dodavatel pro vládní a obranné zákazníky), ale je to konkrétní protipól ke skepsi z minulého týdne o tom, jestli výnosy drží tempo s investicemi.
Teorie mysli u vision-language modelů se rozpadá podle úlohy
Tým z University of Maryland otestoval devět špičkových VLM na dvou psychologických úlohách teorie mysli — Keysarově “director task” (prostorová perspektiva) a animovaných trojúhelnících Frith–Happé (čtení záměru z pohybu). Bez chain-of-thought modely dělaly stejnou egocentrickou chybu jako děti, ne dospělí, v 78 % pokusů; u trojúhelníků byl jejich profil přisuzování záměru víc než třikrát blíž průměru dospělých s vysoce funkčním autismem než typickému dospělému průměru. Klíčové zjištění není konkrétní číslo, ale to, že profil modelů se mezi dvěma úlohami měřícími podobnou schopnost výrazně liší — “teorie mysli” u LLM tedy není jedna koherentní schopnost, ale soubor úzkých dovedností, které selhávají různě podle zadání. Dobře to zapadá do vzorce z minulého týdne (Astra vs. shadow evaluations): AI vypadá silně tam, kde je úloha ostře definovaná, a rozpadá se v nejednoznačnějších, lidštějších testech.
GitHub Copilot CLI: worktrees a výkon, ne nové schopnosti
Verze 1.0.78 přidává experimentální /new-worktree pro paralelní práci ve více git worktrees z jedné CLI relace, přepínač /permissions pro rychlou změnu úrovně oprávnění a výrazně rychlejší a paměťově úspornější obnovení dlouhých relací díky jednorázovému načtení historie při startu. Nic z toho není objev — je to údržba kategorie, která už funguje, a potvrzuje trend z minulých dnů (stacked PRs u GitHubu i Devinu): agentní kódovací nástroje teď soutěží ve workflow detailech, ne v demo efektech.
Claude Code: úklid rozhraní, ne skok vpřed
Verze 2.1.221 přidává “Focus View” (skrývá šum z volání nástrojů za rozbalitelné shrnutí tahu), maskování přihlašovacích údajů v Linux/WSL sandboxu a opravy oprávnění v Bash a PowerShellu. Řadí se do stejné kategorie jako Copilot CLI výše — bodová vydání, která zlepšují použitelnost už existujících agentních nástrojů, ne jejich schopnosti.
Komentář#
Dnešek je po dvou dnech nabitých vydáními, dopisy a bezpečnostními incidenty nápadně tichý na straně velkých labs — ani jeden nový frontier model, žádná nová regulace, nic z Číny. Nebral bych to ale jako důkaz zpomalení; spíš jako připomínku, že tempo posledních dní bylo výjimečné, ne normál. Zajímavější je, kam se pozornost přesunula: k číslům, ne k prohlášením.
Palantirova čtvrtletní čísla jsou přesně ten typ důkazu, který v debatě o AI bublině chybí nejvíc — ne dopis o budoucím riziku, ne investiční kolo se sázkou na poptávku, která ještě nepřišla, ale tržby, které firma už fakturovala. Sledoval bych, jestli se podobná čísla objeví i u dodavatelů mimo vládní/obranný segment, kde je adopce AI míň vynucená a víc dobrovolná — tam bude test věrohodnější.
Microsoftův Orchard stojí za pozornost hlavně jako další datový bod v trendu, který jsme psali u DeepSeeku a Alibaby celý týden: honba za parametry ustupuje honbě za efektivitou tréninku. Tři miliardy aktivních parametrů na 70 % SWE-bench Verified zní impozantně, ale je potřeba to číst spolu s rostoucími pochybami o tom, jak moc jsou dnešní agentní benchmarky vůbec nesaturované — bez nezávislého ověření je to slibný signál, ne potvrzený fakt.
Paper o teorii mysli u vision-language modelů bych bral jako užitečnou protiváhu k týdnu plnému tvrzení o blížící se AGI. Ukazuje přesně to, co Astra vs. shadow evaluations minulý týden: schopnosti modelů nejsou jedna stoupající křivka, ale mozaika úzkých dovedností, které se v jednotlivých testech chovají nepředvídatelně — a čím blíž k lidskému úsudku, tím hůř.
A dvě bodová vydání vývojářských nástrojů (Copilot CLI, Claude Code) potvrzují, že kategorie agentních kódovacích asistentů je teď v fázi údržby a UX ladění, ne závodu o nové schopnosti — což je nudná, ale zdravá známka toho, že nástroje reálně používají lidé v každodenním provozu, ne jen v demech.
Poznámka k rešerši: pokrylo se období od posledního přehledu (2026-08-03) do teď. Přímý přístup byl blokován na úrovni síťové politiky prostředí (ne jednotlivých webů) téměř ke všem primárním zdrojům ze ZDROJE.md — Anthropic, OpenAI, Google/DeepMind, Meta, Microsoft Azure, Mistral, Nvidia, čínské labs (DeepSeek, Qwen, Moonshot, MiniMax, Baidu, ByteDance), Hugging Face, arXiv listing stránky, Hacker News, The Verge, TechCrunch, Ars Technica, Simon Willison, Jack Clark i regulační zdroje (digital-strategy.ec.europa.eu, artificialintelligenceact.eu, ctu.gov.cz, EC presscorner) — stejný vzorec blokování jako u včerejšího přehledu. Nahrazeno cíleným web vyhledáváním, což pokrytí zúžilo. Regulační a čínská beat po expanzi rešerše nepřinesly žádnou ověřitelnou novou položku od 2026-08-03 — jde o skutečně tichý úsek, ne jen o mezeru ve zdrojích. Dva nalezené kandidáti (globální dostupnost Qwen3.8-Max, Cursor pluginy pro Google Workspace) byly kvůli neshodujícím se datům v různých zdrojích vynechány, aby se předešlo nepřesnému zařazení. Po rozšíření okna a dodatečném ověřování zůstalo 5 položek — méně než obvyklých 15–25, ale všechny s ověřeným primárním zdrojem.