TL;DR#

  • Anthropic zveřejnil výsledky, podle kterých Claude (Opus 4.8 a Mythos Preview) navrhl funkční proteinové vazebné molekuly pro 14 z 15 zadaných cílů, s úspěšností jednotlivých návrhů 22–35 % oproti běžným 10–15 % v oboru — nezávisle ověřily laboratoře Adaptyv Bio a Twist Bioscience. Anthropic
  • ByteDance podle čínského tisku reorganizoval tým pro foundation modely Seed a zakladatel Zhang Yiming osobně najal bývalého klíčového výzkumníka DeepSeeku Guo Daya na posílení kódovacích schopností. TechNode
  • Pew Research zjistil, že 52 % Američanů je z rostoucího používání AI “více znepokojeno než nadšeno” — nárůst z 37 % v roce 2021; u dospělých do 30 let je to poprvé většina (55 %). Pew Research
  • Nezávislá organizace GuideLight AI Standards zveřejnila první hodnocení kontrolních mechanismů pěti frontier labů — Anthropic a OpenAI dostaly nejlepší známku C+ (2,50 z 5), Google D+, xAI D− a Meta nejhorší F (0,67). GuideLight AI Standards
  • Google oznámil, že jeho otevřená modelová rodina Gemma překročila miliardu stažení. Google

Analýza#

Claude navrhl funkční proteinové vazebné molekuly pro 14 z 15 cílů

Anthropic zveřejnil výsledky kampaně s biotechnologickými laboratořemi Adaptyv Bio a Twist Bioscience, které nezávisle vyrobily a otestovaly proteinové vazebné molekuly navržené modely Claude Opus 4.8 a Mythos Preview — z 15 zadaných cílů vznikla funkční vazebná molekula pro 14 z nich, s úspěšností jednotlivých návrhů 22 až 35 % podle konkrétního nastavení, zatímco v oboru je běžná úspěšnost 10 až 15 %. Anthropic sám dodává, že jde o předběžné výsledky — plánuje podrobnější charakterizaci k potvrzení míry záchytu a síly vazby a přiznává, že neví, proč byl u jednoho cíle úspěšný Opus 4.8, ale Mythos Preview ne. Je to konkrétnější příklad praktického dopadu AI na vědu než dosavadní tvrzení o “vyřešeném problému” — výsledek prošel nezávislou laboratorní validací, ne jen benchmarkem.

ByteDance reorganizoval tým Seed, najal klíčového výzkumníka DeepSeeku

Podle čínského serveru TechNode, navazujícího na dřívější zprávy LatePost a Financial Times, ByteDance reorganizoval tým pro foundation modely Seed — sloučil zdroje z Volcano Engine, Feishu a Doubao a zrušil interní paralelní vývoj konkurenčních týmů na stejný cíl. Zakladatel Zhang Yiming podle zprávy osobně najal Guo Daya, dřívějšího klíčového výzkumníka DeepSeeku, aby posílil kódovací schopnosti modelu; CEO Liang Rubo měl na interním setkání přiznat, že mezera mezi Seedem a špičkovými zahraničními modely se zvětšuje. Zpráva zatím nemá oficiální potvrzení od ByteDance. Navazuje na srpnovou zprávu o plánu modelu s 5 až 10 biliony parametrů mířícím na dohnání Anthropicu velikostí — teď je vidět, že za tím číslem stojí i personální a organizační přestavba, ne jen navýšení výpočetního rozpočtu.

Pew Research: 52 % Američanů je z AI víc znepokojeno než nadšeno

Průzkum Pew Research mezi americkými dospělými ukázal, že 52 % je z rostoucího používání AI “více znepokojeno než nadšeno” — nárůst z 37 % v roce 2021, kdy Pew položil stejnou otázku poprvé; podíl “více nadšených než znepokojených” klesl na 9 % z 18 % v roce 2021. Nejvýraznější posun je u dospělých do 30 let, kde je teď poprvé většina (55 %) víc znepokojená než nadšená, hlavně kvůli obavám o pracovní místa — 71 % Američanů celkově očekává, že AI za 20 let sníží počet pracovních míst pro lidi. Je to datové podložení toho, co Dario Amodei minulý týden označil za “krizi důvěry” — čísla ukazují rostoucí, ne stagnující nedůvěru, nejsilnější právě u generace, která má AI používat nejdéle.

GuideLight AI Standards: žádný frontier lab plně nekontroluje vlastní AI systémy

Nezávislá organizace GuideLight AI Standards, založená bývalými specialisty OpenAI a financovaná bez peněz od AI firem, zveřejnila první hodnocení šesti základních kontrolních praktik (logování činnosti interních AI, měření spolehlivosti monitoringu, povinné schválení monitorem před rizikovými akcemi) u pěti frontier labů. Anthropic a OpenAI dostaly nejlepší známku C+ (2,50 z 5 bodů), Google D+ (1,50), xAI D− (0,83) a Meta nejhorší F (0,67); žádná firma v žádné praktice nepřekročila 3 body z 5. Hodnocení vychází jen z veřejně dostupných informací, takže reálný stav může být lepší i horší — ale je to jeden z prvních pokusů srovnat laby podle konkrétních kontrolních opatření, ne podle proklamací o bezpečnosti.

Cursor rozšířil cloudové agenty o sledování PR a dlouhotrvající úkoly

Cursor rozšířil cloudové agenty o funkce pro delší a méně dohlížené úlohy: nově podporují událostmi řízené “subscriptions” (sledování pull requestů, Slack vláken), izolovaná sub-agentní prostředí pro paralelní dílčí úkoly, příkaz /goal pro zadání dlouhotrvajícího cíle a neblokující “steering” — možnost agenta za běhu nasměrovat, aniž by se musel zastavit. Navazuje to na spuštění platformy Origin (18.8.) — Cursor systematicky staví agenty, kteří fungují nezávisleji a déle bez přímého lidského dohledu nad jednotlivými kroky.

Gemma od Googlu překročila miliardu stažení

Google oznámil, že jeho otevřená modelová rodina Gemma překročila miliardu stažení. Připojuje se tak k Qwenu od Alibaby, který nedávno oznámil 3 miliardy stažení za posledních šest měsíců — otevřené váhy dnes stahují a nasazují vývojáři v řádu miliard bez ohledu na to, jak intenzivně se o rizicích otevřenosti debatuje na politické úrovni. Milník zároveň připomíná, že v této soutěži o počty stažení hraje i Google, ne jen čínské laby, které v posledních týdnech dominovaly titulkům o otevřených modelech.

Komentář#

Anthropicova studie o proteinovém designu je vzácný příklad AI zprávy, která obstojí i po skepticky vedené kontrole: výsledek ověřily nezávislé laboratoře, ne benchmark, a firma sama přiznává limity (“nevíme proč”). Přesně tohle chybí většině tvrzení o vědeckém přínosu AI, která jsme v posledních týdnech viděli.

Číslo 52 % z Pew Research dává tvrdá data pod to, co Dario Amodei nazval “krizí důvěry” — a přichází přesně do týdne, kdy OpenAI samo předvedlo, jak taková nedůvěra vzniká : jedna ruka slibuje zákazníkům minimální přístup k datům, druhá (Sam Altman v rozhovoru) sní o ChatGPT, který sleduje obrazovku a nahrává hovory. Amodei tvrdí, že za nedůvěru nemůže komunikace labů o riziku — Pew data ale ukazují, že lidé nedůvěřují hlavně kvůli obavám o práci, a nesourodé signály od samotných firem tomu očividně nepomáhají.

GuideLightovo hodnocení, že žádný lab plně nekontroluje vlastní interní AI systémy, dostává v tomhle týdnu konkrétní ilustraci: Cursor dává cloudovým agentům víc autonomie a míň bodů, kde musí čekat na člověka, a ByteDance přetahuje klíčové výzkumníky, aby zrychlil vývoj vlastního modelu — závod o agentní autonomii a schopnosti běží dál, zatímco kontrolní mechanismy podle nezávislého hodnocení zaostávají za tempem nasazení.

Miliarda stažení Gemmy vedle 3 miliard u Qwenu ukazuje, že rozhodnutí o otevřenosti vah dnes nedělá jen jeden lab nebo jedna vláda — dělá ho z velké části trh, a to napříč americkými i čínskými laby zároveň, ne v jednom táboře.

Ostatní#

Mistral představil Agentic Search — vrstvu pro vyhledávání, kde model iterativně prohledává, prochází a ověřuje informace napříč složitými dokumenty místo jednorázového dotazu; firma uvádí až trojnásobné zlepšení přesnosti na finančních výkazech oproti klasickému RAG přístupu. Mistral

Programovací jazyk Mojo od startupu Modular, navržený pro vysoce výkonné AI workloady, byl otevřen jako open source. Simon Willison

Nový benchmark Thinkingbox testuje agenty na byznysových úlohách (retail, pojišťovnictví, bankovní podpora) podle toho, jestli skutečně dovedou úkol do cílového stavu, ne jen podle validity tool-callů. Nejlepší model uspěje na první pokus v 65 % případů, ale při opakování téhož úkolu dvacetkrát si úspěch drží jen ve 25 % — jednorázový úspěch v testu nic neříká o spolehlivosti při nasazení. arXiv

Indická vláda vyzvala Metu, ať nenechává rozhodování o odstraňování obsahu čistě na AI a zachová lidský dohled — reakce na rostoucí spoléhání platforem na automatizovanou moderaci. Business Standard

Další studie Pew Research zjistila, že přes třetinu (35 %) anglicky psaných webových stránek publikovaných od spuštění ChatGPTu nese jasné známky AI autorství — u obsahu z letošního července je to poprvé přes třetinu, zatímco domén .edu a .gov se to týká zhruba desetkrát méně než domén .com. Pew Research


Poznámka k rešerši: souběžné běhy mezitím publikovaly přehledy za 19. a 20.8., takže dnešní vydání pokrývá jen zbytek okna od 20.8. Několik původně nalezených položek (OpenAI pauza tréninku Astry, OpenAI Zero Data Retention/Private Safety Processing) se s těmito přehledy překrývalo a bylo vynecháno jako duplicita. Domény helpnetsecurity.com, securityweek.com, technode.com, theverge.com a arstechnica.com blokuje síťová politika prostředí (EGRESS_BLOCKED) — zprávy z nich ověřeny přes web search, ne přímým stažením. jack-clark.net vrátil HTTP 403 i přes RSS. Z čínských zdrojů nešly načíst research.baidu.com, qwen.ai, minimax.io a moonshotai.github.io; u Moonshotu a Qwenu se objevily jen drobné verze CLI nástrojů, které se kvůli malému významu do přehledu nedostaly.