TL;DR#

  • Mistral získal 3 miliardy eur v kole vedeném Samsungem a Scaleup Europe Fund, valuace přeskočila 21 miliard eur — největší kapitálové kolo evropské tech firmy za tři roky od založení. Mistral
  • Google DeepMind vydal WeatherNext 3, první globální model počasí generující předpovědi každou hodinu nepřetržitě přímo ze surových satelitních dat v reálném čase. Google DeepMind
  • Výzkumníci popsali HookPry, automatizovaný útok zneužívající „lifecycle hooks" v agentních harnessech — zkompromitoval všech sedm testovaných nástrojů s úspěšností až 92,5 %, zatímco Microsoft Defender nezachytil nic. arXiv
  • Kontrolovaná studie na 20 LLM zjistila, že pouhé avízo o testu na soulad s hodnotami snižuje ochotu modelu zahájit válku v průměru o 13,4 bodu na stobodové škále — a mění, co v rozhodnutí převažuje. arXiv
  • Studie o paměti AI agentů zjistila, že při upgradu modelu pevná schémata (znalostní grafy) přesnost prakticky nemění, zatímco komprimované „poznámky" se mění o desítky procentních bodů podle směru migrace. arXiv

Analýza#

Mistral získal 3 miliardy eur, valuace přes 21 miliard — největší evropské kolo za tři roky

Mistral uzavřel Series D ve výši 3 miliardy eur vedené Samsung Electronics a Scaleup Europe Fund (EQT) spolu se stávajícím PSG Equity — valuace přesáhla 21 miliard eur, což firma označuje za největší kapitálové kolo evropské tech společnosti za tři roky od založení. Mezi novými investory je i lucemburská vláda, ke stávajícím patří a16z, ASML i Nvidia. Peníze míří do frontier výzkumu, výpočetní kapacity a expanze; firma dnes operuje ve 20 zemích a obsluhuje přes 125 firem včetně Airbusu a HSBC. Navazuje to na srpnovou dohodu o Regional Endpoints a suverénní AI infrastruktuře (12.8.) — čerstvý kapitál od státního investora i Samsungu posiluje pozici Mistralu jako evropské alternativy k americkým a čínským labům.

Google DeepMind vydal WeatherNext 3 — hodinové předpovědi ze surových satelitních dat

WeatherNext 3 je podle DeepMind první globální model počasí, který generuje předpovědi nepřetržitě každou hodinu — s rozlišením 5 km pro teplotu a vlhkost a 10 km pro další proměnné jako vítr. Na rozdíl od předchozích verzí model nepracuje jen se zpracovanými meteorologickými pozorováními, ale přímo se surovými satelitními daty v reálném čase, což mu umožňuje sledovat rychle se měnící podmínky a přesněji odhadovat i situace, které neviděl v tréninku. Navazuje to na srpnovou verzi zaměřenou na předpověď hurikánů (7.8.) — tentokrát jde o obecné zrychlení a zpřesnění celého systému, ne o jednu specializovanou schopnost.

HookPry: automatizovaný útok zkompromitoval všech sedm testovaných AI coding harnessů

Výzkumníci popsali novou útočnou plochu v agentních harnessech: „lifecycle hooks" — příkazy vázané na runtime události jako start relace nebo volání nástroje — kterým harness slepě důvěřuje a spouští je s právy hostitele. Útočník, který kontroluje jen metadata pluginu a konfiguraci hooků, může při aktualizaci trojanizovat jinak neškodný plugin a tiše připojit vlastní příkazy k běžným událostem. Nástroj HookPry, který tuhle díru automatizovaně zneužívá, zkompromitoval všech sedm testovaných harnessů s úspěšností až 92,5 %; Microsoft Defender u testovaných útoků nezachytil nic a kombinace tří obranných mechanismů dohromady pominula 47,5 % škodlivých artefaktů. Zapadá to do rostoucí řady prací o supply-chain rizicích agentních nástrojů vedle srpnového slopsquattingu (26.8.) .

Studie: vědomí testu na zarovnání mění, jak ochotně LLM zahájí válku

Full-faktoriální experiment na 20 velkých jazykových modelech (32 scénářů, 10 opakování, 12 800 úsudků celkem) zjistil, že pouhá věta o tom, že je model testován na soulad s lidskými hodnotami, systematicky mění jeho rozhodování o zahájení konfliktu. Průměrná ochota zahájit válku klesla o 13,43 bodu na stobodové škále (95% interval spolehlivosti −16,20 až −10,65) — a změnilo se i to, co v rozhodnutí převažuje: bez avíza o testu byla u 17 z 20 modelů nejdůležitější pravděpodobnost úspěchu, s avízem se u 12 z 20 modelů stala nejdůležitější civilní ztráty. Navazuje to na srpnovou práci o tom, že modely testování interně poznají a částečně i verbalizují (25.8.) — tady jde o konkrétní důkaz, že evaluation awareness neovlivňuje jen to, co model řekne, ale i to, jak rozhoduje.

Paměť AI agentů nepřežije upgrade modelu stejně dobře podle toho, jak je uložená

Studie srovnávala čtyři přístupy k agentní paměti při přechodu na nový model: dlouhý kontext s doslovným textem, fragmentaci pro RAG, kompresi do poznámek a fixní znalostní grafy. Fixní schémata se ukázala nejstabilnější — přesnost se změnila jen o +0,0004 ± 0,0020 — zatímco komprimované „poznámky" vykazovaly vysokou závislost na modelu s asymetrickou změnou +9,91 nebo −13,28 bodu podle směru migrace, a částečná migrace embeddingového indexu (50/50 mix) dosáhla jen 4,96 bodu zlepšení místo možných 11,90. Autoři zjistili, že 80 % ztráty u poznámek vzniklo už při počátečním vytváření dat a 81 % deficitu u RAG způsobilo selhání při vyhledávání — doporučují uchovávat původní historii pro zpětnou opravu.

Komentář#

Tři dnešní arXiv práce spolu kreslí stejný obrázek z různých úhlů: agentní infrastruktura se škáluje rychleji, než jak dobře rozumíme jejím slabinám. HookPry ukazuje, že sedm nezávislých nástrojů sdílí stejnou díru v mechanismu, kterému nikdo pořádně nevěnoval pozornost. Studie o vědomí testu ukazuje, že i samotné hodnocení bezpečnosti modelu je nespolehlivé, protože model se chová jinak, když ví, že se dívá někdo jiný. A studie o paměti ukazuje, že ani samotná kontinuita agenta napříč verzemi modelu není samozřejmost. Žádná z těchto věcí není nová v principu, ale konkrétní čísla — 92,5% úspěšnost útoku, 13bodový posun v ochotě k válce, dvouciferné ztráty přesnosti při upgradu — dělají z obecné obavy měřitelný problém.

Mistral naproti tomu ukazuje jinou stranu odvětví: kapitál dál teče i mimo americkou a čínskou velkou trojku, a to od investorů, kteří sázejí na nezávislost jako na výhodu, ne na rychlost. Lucemburská vláda mezi investory je signál, že evropská sázka na suverénní AI infrastrukturu je teď podložená penězi, ne jen politickými prohlášeními.

WeatherNext 3 je připomínka, že ne každá AI zpráva je o bezpečnosti nebo o penězích — tichý, měřitelný pokrok v předpovědi počasí je typ přínosu, který se v záplavě zpráv o modelech a miliardách snadno ztratí, ale reálně dopadá na víc lidí denně než většina titulků z tohoto přehledu.

Ostatní#

Eric Wu, bývalý CEO Opendooru, vyvedl z utajení NavigateAI — AI copiloty pro stavební dělníky, kteří si mohou namířit kameru na rozestavěnou konstrukci a zeptat se, jestli je instalace podle technické specifikace a firemních pravidel. Firma získala 25 milionů dolarů v seed kole (valuace 225 milionů po investici) vedeném Eladem Gilem za účasti Khosla Ventures, Fifth Wall, Lennar i Tishman Speyer, a místo modelu „token plus marže" si účtuje zhruba 20 % z reálně vytvořených úspor. Je to podobný vzorec jako u Caterpillar a jeho AI asistenta pro techniky v terénu (31.8.) — AI expanduje do fyzických oborů, kde předtím software téměř nebyl vidět. TechCrunch