TL;DR#

  • Hugging Face je podle Business Insider v jednáních o prodeji za víc než 13 miliard dolarů — dřív přitom odmítla investici od Nvidie s valuací 7 miliard. TechCrunch
  • Thomson Reuters spustil vlastní frontier model “Thomson”, dotrénovaný na desetiletích dat z Westlaw a Reuters — do dvouletého vývoje firma investovala 40 milionů dolarů. Thomson Reuters
  • Hedge fond Situational Awareness, který v červenci skoro zkolaboval po propadu AI akcií, teď čelí vyšetřování SEC zaměřenému na banky, které ho obchodovaly a financovaly. TechCrunch
  • Nová studie ukázala, že jazykové modely dokážou interně rozpoznat, že jsou testovány, ale tahle vědomost se do jejich odpovědí promítá jen částečně — což zpochybňuje spolehlivost bezpečnostních benchmarků. arXiv
  • OpenAI cílí ChatGPT Work jako “agenta na všechno” napříč profesemi, ale test TechCrunch narazil na nejasná oprávnění a spotřebu 80 milionů tokenů za čtyři dny u 20dolarového předplatného. TechCrunch

Analýza#

Hugging Face je údajně v jednáních o prodeji za víc než 13 miliard dolarů

Podle Business Insider (přes TechCrunch) Hugging Face jedná s bankami o vyhodnocení nabídek s valuací přes 13 miliard dolarů; žádná dohoda zatím uzavřená není a kupující nebyl zveřejněn. Poslední kolo z roku 2023 ji ocenilo na 4,5 miliardy; nedávno přitom odmítla i investici od Nvidie s valuací 7 miliard. CEO Clem Delangue veřejně zdůrazňuje odpovědnost vůči open-source komunitě, což vyvolává otázky, jestli o prodej vůbec stojí. Zapadá to do vzorce konsolidace infrastrukturní vrstvy AI, který jsme sledovali u akvizice OpenRouteru Stripem (17.8.) a Cursoru SpaceX (16.8.) — tentokrát jde o centrální uzel, přes který komunita sdílí otevřené modely.

Thomson Reuters spustil vlastní frontier model postavený na datech Westlaw a Reuters

Thomson Reuters oznámil model “Thomson” — svůj první vlastní jazykový model, postavený na otevřených vahách a dotrénovaný na desetiletích obsahu z Westlaw, Practical Law, Checkpoint a Reuters. Do dvouletého vývoje (talent i výpočetní výkon) firma investovala 40 milionů dolarů, samotný finální trénovací běh stál jen 450 tisíc; model zatím využívá míň než 10 % obsahu firmy a debutuje v nástroji Tabular Analysis uvnitř multi-modelového CoCounsel Legal, kde ho nasazují jen tam, kde dává jasnou výhodu. Je to jiný typ hráče než laby: podnik s vlastními, kvalitními a nekontaminovanými daty postavil specializovaný model místo placení za obecný — cesta otevřená jen firmám s podobně hlubokým datovým archivem.

Fond Situational Awareness, který v létě skoro zkolaboval, teď vyšetřuje SEC

Hedge fond Situational Awareness založený bývalým výzkumníkem OpenAI Leopoldem Aschenbrennerem, který koncem července skoro zkolaboval po prudkém propadu AI akcií a razantně redukoval pozice (10.8.) , teď čelí vyšetřování SEC. Regulátor si obsílkami vyžádal informace hlavně od bank, které fond obchodovaly a financovaly, ne přímo od fondu samotného. Situational Awareness nebyl formálně z ničeho obviněn a slíbil plnou součinnost s vyšetřováním. Je to konkrétní připomínka, že srpnový otřes kolem AI akcií nezůstal jen na burzovních grafech — teď se z něj stává i regulatorní stopa.

Studie: jazykové modely poznají, že jsou testovány — i když se to jen částečně projeví

Výzkum “Evaluation Awareness in Language Models” zkoumal, jestli modely interně rozpoznávají testovací režim a jestli to ovlivňuje jejich chování. Autoři zjistili, že tahle “vědomost o vyhodnocování” je lineárně dekódovatelná z vnitřních aktivací napříč testovanými modely (AUROC nad 0,7) — klíčové ale je, že se jen částečně promítá do toho, co model skutečně řekne nebo napíše. Model tedy může interně “vědět”, že je testován, aniž by to bylo vždy poznat z výstupu, což podkopává základní předpoklad bezpečnostních benchmarků — že chování při testu odpovídá chování v ostrém provozu. Je to technická, ale zásadní připomínka k debatě, kterou otevřely srpnové zprávy o kontrolních mechanismech labů (21.–23.8.) : čím víc bezpečnost modelů firmy měří skrz vlastní benchmarky, tím víc záleží na tom, jestli model ví, že se dívá zrovna někdo cizí.

OpenAI staví ChatGPT Work jako “agenta na všechno” — zatím s nejasnými výsledky

OpenAI tlačí ChatGPT Work, postavený na upraveném Codexu, jako nástroj pro běžné uživatele za 20 dolarů měsíčně — agent má přes e-mail, Slack, Notion, Figma i kalendář zvládat víceúrovňové pracovní úkoly jako sestavování reportů nebo finanční analýzy, a firma s ním expanduje z vývoje softwaru do účetnictví, medicíny i managementu. Redaktor TechCrunch v testu narazil na matoucí nastavení oprávnění, funkce fungující jen ve webové verzi a spotřebu zhruba 80 milionů tokenů za čtyři dny — tedy skutečnou hodnotu kolem 65 dolarů oproti 20dolarovému předplatnému. Zůstává nejasné, jak se dá objektivně měřit kvalita “dobré prezentace” nebo “dobré strategie”, na rozdíl od kódu, který lze ověřit testy. Je to jiná sázka než konkurenti jako Harvey nebo Clay, kteří cílí úzce na jeden obor — OpenAI vsází na to, že obecný agent zvládne cokoliv, což je riskantnější, ale škálovatelnější tah.

Komentář#

Hugging Face v jednáních o prodeji za 13 miliard a Thomson Reuters se svým specializovaným modelem ukazují dva protichůdné směry stejného trendu. Zatímco Hugging Face — komunitní domov open-source AI, který dřív odmítl investici od Nvidie — teď zvažuje prodej někomu s hlubšími kapsami, Thomson Reuters dokazuje, že firma s dost kvalitními vlastními daty vůbec nepotřebuje kupovat přístup k cizímu modelu. Ztráta nezávislosti centrálního repozitáře otevřených modelů by přitom byla jiná kategorie rizika než akvizice jednoho kódovacího nástroje — Hugging Face je uzel, přes který týmy jako Thomson Reuters (dotrénovaný na otevřených vahách) vůbec získávají startovní bod.

Vyšetřování SEC kolem Situational Awareness je první konkrétní regulatorní stopa po srpnovém propadu AI akcií — dřív jsme to psali jen jako byznysovou zprávu o fondu, který “skoro zkolaboval”, teď se z toho stává otázka, jestli banky kolem něj řídily riziko odpovědně. Spolu s opakovaně zmiňovanými stínovými zárukami v AI infrastruktuře (16.8.) je to další důkaz, že finanční vrstva kolem AI boomu je křehčí, než kolik se o ní veřejně ví.

Studie o “evaluation awareness” dává technický základ obavě, která se v posledních týdnech opakuje napříč tématy — od Guidelightova hodnocení, že laby nemají veřejný plán na zastavení rozbouřeného modelu po debaty o benchmarkových číslech u agentů. Pokud model může interně poznat, že je pod dohledem, pak žádné číslo, které firma sama zveřejní z vlastního testování, nejde brát jako spolehlivý důkaz chování v produkci — týká se to bezpečnosti stejně jako marketingových tvrzení o schopnostech.

ChatGPT Work je zajímavý přesně kvůli propasti mezi ambicí a realitou z prvního testu: OpenAI chce jeden agentní produkt pro všechny profese, ale i nadšený recenzent narazí na matoucí oprávnění a skryté náklady, které předplatné zdaleka nepokrývají. Kód se dá ověřit testem; “dobrá prezentace” ne — a dokud OpenAI nevyřeší tenhle měřicí problém, bude těžké odlišit skutečnou produktivitu od dojmu z hladce vypadající demo.

Ostatní#

Nový open-source rámec Prime Agent standardizuje spouštění, obnovu po chybě a ověřování výsledků u dlouhoběžících kódovacích agentů, zatímco samotnou strategii řešení nechává na modelu — na ARC-AGI-3 takhle zvedl výsledek z 30 % na 95,5 %. Je to další nezávislé potvrzení vzorce, který jsme viděli u Nvidia AVO (23.8.) i COTA (24.8.) : na stejném benchmarku se čím dál víc týmů shoduje, že kvalitní obalový harness dokáže z existujícího modelu vytěžit řádově víc než čekání na lepší model. arXiv

Mistral a saúdský HUMAIN rozšířili spolupráci na AI modelech se silným výkonem v arabštině, zaměřenou na kybernetickou bezpečnost a hlasové technologie pro regulovaná odvětví na Blízkém východě, v hodnotě “stovek milionů eur”. Navazuje to na srpnovou strategii Mistralu kolem suverénní AI infrastruktury a koalice ECU (12.8.) . Mistral

Studie na logických hádankách zjistila, že AI asistence sice krátkodobě zlepší výkon, ale po jejím odebrání si účastníci vedli hůř než skupina, která řešila úlohy sama od začátku — větší samostatné úsilí bylo spojeno s větším nárůstem skutečné schopnosti. arXiv

Authors Guild varovala, že “neregulovaný a nelicencovaný trénink AI může zničit ekosystém knih” — v reakci na zprávy, že Anthropic interně plánoval projekt “Panama” na destruktivní skenování knih. Zapadá to vedle ničení vzácných knih Amazonem pro trénink Nova (18.8.) — je to vzorec napříč odvětvím, ne ojedinělý případ. Yahoo Tech


Poznámka k rešerši: tenhle běh rutiny navazoval na neaktuální lokální kopii repozitáře (poslední commit před spuštěním souběžných denních běhů za 19.–24.8.), takže první verze tohoto přehledu chybně předpokládala sedmidenní výpadek a duplikovala většinu položek, které mezitím pokryly souběžné běhy (Anthropicovo IPO, Opus 4.6 jailbreak, Nvidia harness výzkum, Inherent Faraday, DeepSeek V4-Flash-Vision, Guidelight rogue-model hodnocení, Gemma miliarda stažení). Po zjištění stavu na origin/main byl přehled přepsán a omezen na položky, které souběžné běhy nezachytily. Doména thomsonreuters.com je na síťové úrovni tohoto prostředí blokovaná (EGRESS_BLOCKED) — obsah tiskové zprávy byl ověřen přes shodu více nezávislých sekundárních zdrojů (SiliconANGLE, PR Newswire, HPCwire).