← Zpět na hlavní stránku

Lokální AI doma: DeepSeek, Qwen a stroj za čtvrt milionu

·1:29:08
Shrnutí epizody

Tato epizoda rozebírá technické a praktické aspekty provozování lokálních jazykových modelů jako DeepSeek, Kimi nebo Qwen na vlastním hardwaru. Jiří Bernovský vysvětluje klíčovou roli kvantizace a nároky na VRAM u grafických karet při stavbě domácí AI stanice. Tento podcast o umělé inteligenci přináší konkrétní pohled na energetickou náročnost a budoucnost otevřených modelů v evropském kontextu. Diskuse nabízí hluboký vhled do toho, jaké technologické novinky česky ovlivňují současnou AI scénu.

Hlavní body

Přepis epizody

Když tam přijdeš, tak tam máš endpoint a dokud konzumějš její věci, tak se můžeš napojit svoje aplikace na jich endpoint. Ty modely jsou všechny hodně dolevo. Tak ahoj všichni, máme tu 13. díl našeho podcastu, kde skončí zítřek, dneska s naším dalším hostem, kterým je Jirka Bernovský, ahoj. Ahoj. Ahoj. Ahoj. Když jsem zainvestoval do NVIDIA Spark OM verze od ASUSu a ASUS Ascent GB10, prostě stroj, o kterém jsem dlouho přemýšlel, o kterém jsem tak trošku pohrdal, protože mám relativně pomalu paměť a teď mi na něm běží a i klientovi, firmnímu, respektive už dvěma, teď teda běží DeepSea 24, Flash 07, 31 a ty hlasy jsou zatím super. Takže vlastně teda bude, že velké hlasy znamená Kimika 3, který je teďka největším otevřeným modelem, který je k dispozici a bylo to až takové hlasy, že vlastně Číněni trošku zvažovali, jestli takové modely do budoucna budou nebo nebudou pouštět. Jak to o tom myslíš? Jak moc je už ten Kimi dobrý? No, Kimi je velice dobrý. Kimi šlapé na paty modelům, který byly před půl rokem mezi těmi top modely od uzavřených laboratoří a uzavřené váhy a teď vlastně je to tuším 2,8 trilionů parametrový model, který byl vydaný, který je open weight, není úplně open source, ale prostě je open weight a je velice výkonný a dá se používat na velkou spoustu věcí. A spousta lidí na něm šetří spoustu peněz, protože stojí zlomek toho, co stojí ty vrcholové modely od OpenAI nebo od Anthropic. Jo. No a co říkáš tomu, že vlastně oni to vydali a za 48 hodin byla vyčerpaná jejich hardverová kapacita a všichni, kdo si dneska to chtějí vyzkoušet, tak včetně mě, tak jediný, co můžou udělat, tak je, že se zapíšou do nějakého waiting listu na jejich stránkách, což ani to, nějakou chvíli nešlo. Já jsem pár dní po tom, co to uvedli, se teda rozhoupal, že si zaplatím nějaký předplatny, abych to vyzkoušel a bylo to úplně jako closed. Nic nešlo, teďka jsem tam už někde na nějaký čekačce, vůbec nevím, kde si dočkám, tak je to, myslíš, problém Číny z hlediska nějakých sankcí nebo má to vůbec smysl to takhle pouštět do světa z hlediska toho, že stejně se k tomu dostane minimum lidí, protože to mu se takhle utnout? Je naprosto možné, že ta laboratoř byla samopřekvapená prostě tím, jak byl zájem o ten model. Mě otevřeli, já jsem se tam hned zaregistroval a hned jsem si vytvořil účet, který jsem ještě neměl pro Kimio a hned jsem si tam poslal nějaké peníze, takže jsem měl vlastně to štěstí, protože opravdu o pár hodin později jsem četl na Xku, že vlastně omezují ty registrace, že se omluvají, ale že prostě nemají takový početní výkon, takový početní výkon, že se to znamená takový model a na to je otázku jasně no, jako sankce určitě hrajou nějakou roli, protože prostě ty laboratoře nemají volný přístup ke grafickým kartám od NVIDIA a ty grafické karty zatím prostě ty stroje, ty velké klastery grafických karet jsou potřeba na to. Aby jsi dokázal obsluhovat jako statisíce nebo miliony zákazníků, ty prostě potřebuješ. A když je nemáš, tak musíš dělat čekací list. Takže ve výsledku vyvinou skvělej model, dají ho jako open source nebo open base a ve výsledku si to američani potom stáhnou a Silicon Valley na tom šetří prachy, není to trošku postavený na hlavu? No, není ho, tam si to koupí. A tak naprosto stejný případ je to s tou Čínou. Bylo x případů, kdy i poměrně velké firmy doslova prostě pašovali ty grafické karty od NVIDIA z Ameriky přes nějaké další státy do Číny a tam si je prostě číně nekupovali. A ty grafické karty jsou teda potřeba hlavně i na ten trénink těch modelů, protože ten trénink trvá, že je na neuvěřitelné množství prostě resursů, že je na neuvěřitelné množství tady ta energie a to compute power. Takže jo, myslím si, že na ten trénink potřeba teda trošku méněž potom na ten provoz, na ten škalovatelný provoz, který ukáže obospodaři prostě stovky nebo miliony lidí, 100 000 miliony lidí. A nevím, no, sankce určitě přispěly, ale na druhou stranu, když se teď podíváš prostě tak už, jako se proslychají zprávy o tom, že Čína má svoje vlastní grafický karty, který začíne dělat svoje vlastní grafický čipy, který pomalinko nastupujou. A dokonce jsem teď slyšel, že Čína pracuje na litografickém stroji, který je vlastně jediná firma na světě, která to teď vyrábí, že jo, to je Asomolo prostě tady v Evropě. A že snad o dvou let by mohli mít podobný stroj, který umožní vyrábět tak precizní a tak malé čipy, jak s pomocí tady těchto velkých strojů, jako Asomolo. Takže si myslím, že Čína se prostě adaptuje. To, že nasadíš sankce, neznamená, že je zastavíš. Oni jsou velice schopní, mají obrovský potenciál lidí, ten talent je tam neuvěřitelný a mají kde brát prostě. Vytvoříš si vlastní. Bohužel svět jim během posledních 20, 30 let globalizace dal veškerý technologie a Čína to teď využívá. Já, jestli se nepletu, tak myslím, že ten DeepSeek už nějak hohlásil, že kompletně jede na nějakých čipech Huawei. Jasně, Huawei je jedna z těch firm, který... Takže vlastně už existují čínský model, který nepotřebují NVIDI a ten talent asi vypadá to, že bude pokračovat. No, ale když teda... Když teda jsme ještě u toho Kimiho, tak mně přijde trošku paradoxní vlastně to, že Čína udělá takhle obrovský model, jako byl třeba i ten starší, ta dva pětka. Veme to nějaká firma, která se jmenuje Cursor, přetrénuje si to na svý superprogramátorský schopnost, na nějakých syntetických datech a pak dojde k tomu, že přijde Elon Musk a koupí celý tady ten projekt za 60 miliardů dolarů. Tak je to trošku postavený na hlavu, ne? Takže ty modely jak tak putují světem z Číny do Ameriky, v Číně vlastně dělají velký vývoj a v Americe dělají velký peníze. A zase, když si vzpomeneš pár měsíců zpátky, tak Anthropic prostě křičel zloději, zloději ukradli nám data, prostě vytěžili tady. To křičí pořád, ne? Jako reasoning asi křičí pořád a teď dokonce si objíňovali i vlastně toho, kým jeho, tu trojku, že byla vydestilovaná z nějakého modelu. Ono je trošičku problém, že kým jste nám občas hlásí jako klout. Je to tak, ale i modely od Antropiku se občas hlásily, jako modely od OpenAI. Jo, to jsem taky zaznamenal. Já si totiž myslím, že s těmi daty, jak se o tom mluvilo, tak jsem vlastně, že OpenAI na začátku ukradla celý internet. Vytrénovala na tom prostě svoje modely. Pak si to vzali Anthropic, pak si to vzali prostě všichni další. Doslova jako skrýpujou internet každý den, prostě stahujou. Já jsem teď viděl nějaké statistiky, ve kterých člověk popisoval, má nějaký velký web, na ten web chodí hodně lidí a říkal, že sledují, kolik tam chodí těch crawlerů, který skrýpují data. A říkal, tak máme tady třeba denně 400-600 crawlů od Antropics, od OpenAI, ale poslední týden máme 7000 denně od Microsoftu. A proto všichni tady ty poskytovatele přesně sledují, co ten uživatel dělá. Prostě přesně sledují ty reasoning traces, které vedou ke splnění úkolů, z nich potom destilují jako datasety a trénují ty modely. Než by dělali ten basic training, ale dělí prostě ten fine tuning, tady na těchto modelech a vlastně učí ten model, jak se zachovat v tom agentském workflow. A já si myslím, že teď už se ty modely moc netrénují jako na nových a nových datech, samozřejmě nějaká nová data vznikají a trénují se hlavně tady na těchto věcech, protože ty agenti za posledního půl, třičtvrtě roku opravdu převzali tu iniciativu a teď máš dobrého agenta a špatný model, máš skvělé výsledky a špatné výsledky. Takže už opravdu o kvalitě té odvedené práce nerozhoduje jenom ten model, tak ten model je fajn, rozhoduje o tom spolupráce toho agenta, nějakého toho loopu, který běží a toho modelu. Data každopádně došly o tom svědčí i snahy těch velkých společností třeba skenovat nějaký unikátní výtisky knih, který teďka taky kolem toho belvaka kauze, jak ničí staré knihy, aby byly schopné to rychle skenovat. Takže děje se ledacost, ale když si zmínil to agentní chování, tak na druhé straně jako opozici těch obrovských nových modelů, tady máme třeba nový Nemotron 2.5 Lightning od NVIDIA, který naopak nesází na nějakou obrovskou obrovský množství parametrů, co by se měl, ale sází na tu agentní rychlost, píšou až 670 tokenů za sekundu, což pro uživatele možná takové číslo virtuální hodně, ale když se bavíme asi o normálních modelech, tak ty jedou nevím, 60, 100 tokenů za sekundu. Já si myslím, že to, co dostáváte všichni, nebo všichni dostáváme z aplikací, jako je Claude Code a z desktopových aplikací, já taky někde v rozmezí 30 až 50 tokenů za sekundu, což je rychlost, která je jako snesitelná pro uživatele. Podstatně samozřejmě ten perfil je to zpracování toho promptu, ty pošleš nějaký prompt do toho modelu musí zpracovat a musí zpracovat nějakou rychlostí. Ten agent k tomu přidá ještě někdy desítky tisíc tokenů, takže ta zpráva, která odchází na 40 tisíc tokenů, z toho tvých je dvěstě je. A 39 800 jsou prostě všechny tůlkoly a podobné věci, které se staly. - Když máš velkou paměť, tak ještě víc. - Záleží na tom, jak rychle dokáže to datacentrumu zpracovat tady tenhle ten perfil, protože tam se právně počítají jako miliardy operací. Ty se dějí všechny za ráz. A pak se ti to vrátí rychlostí 25-30 tokenů za sekundu a ten model to streamuje, tak ti to přijde v pohodě, protože ten první token dostaneš relativně rychle a pak vidíš, že ti ty tokeny přibývají a 25-30 tokenů za sekundu je něco, co nenokážeš přečíst. Jestli opravdu jsou teda ještě lidi, kteří čitou všechny ty výstupy těch modelů, já už si to nevím představit, že bych to všechno četl, protože mnohdy je tam spousta balastu. - Jasně, tak když se ptáš jako, četu GPT, jaký bude dneska počasí v Brně, tak to přečteš. - A to přečte GPT, nějaké jiné modele v Brně představit přidají, takže už se ptá, jaký bude počasí, takže k tomu, že tam stojí a máš toho stránku najednou, kterou jsi vůbec nechtěl. Ty jsi chtěl prostě dva řádky, kde by bylo napsaný a ráno bude pršet a večer bude 25 stupňů, to je všechno. - A přitom je pořád vedro a oba se tady potíme z toho. - Tak až výrazně, výrazně rychlejší finál, něco hotového, než kdyby to bylo těch 15, 20, 25 okenů za sekundu. - To se ještě asi, bychom se museli bavit o tom kontextovým okně, jak moc se ta rychost udrží v rámci toho, když to okno se... - Ona se samozřejmě neudrží, protože vlastně, když ten kontext se splacovává při každé té generaci. - Já vlastně tady jsem v tom nenašel, jestli to má taky milion tokenů kontextu. Jo, to tady ten model, to teď nevím, ale... - Já si myslím, že ne, já si myslím, že bude 231 tisíc, nebo 256 tisíc, jako kontext. A je možný, že vlastně ano, že to je ten... Ale já například ten kontext při tom milionu docela degraduje a málo kdo ti bude i z těch hyperscalerů servírovat ten model v plné kvalitě. Ty modely v plné kvalitě, když se vezmeš třeba toho Kimiho, o kterém jsme mluvili, tak on má 2,8 trilionů parametrů. A kdyby jsi tam dal to FP32, má to 32-bytovou kvalitu, tak potřebuješ 7,6,4 TB v RAM, výram paměti jenom na to, abys načetl ten model, ale vůbec tam ještě není prostor pro ten kontext, pro ten milion. A to je pro jednoho uživatele. Ale ty těch uživatelů máš prostě stovky tisíc. A ty datový centra potom musí být takhle zdimenzované. Si vem prostě, co to je jako za energii, co to je za množství pamět. jednoduše představitelná věc, to je šílený. Já jsem si to neuměl představit, dokud jsem to nepustil doma, dokud jsem prostě nepochopil, co to je 24 giga grafické paměti, co se s tím dá dělat. Když máš 96, tak co se s tím dá dělat, když máš 128, co se s tím dá dělat. Až jsem to potom viděl, až jsem pochopil, jak se ty modely dají kvantizovat, zmenšovat těch počet bitů na to plovoucí, na to plovoucí číslo, na ten integer, a jak se mění kvalita. Jako tady s tímhle, s tím, tak jsem nechápal, co se děje že se někdo stěžuje, že opus najednou působí hloupě, proti tomu, jak působil minulý týden, ale vím, že úplně já nebo Anthropic zrovna pracují na novém modelu a nasazují nový model a oni mají zase konečné množství toho výpočetního výkonu a někde musí prostě uvolnit místo pro ten nový model, takže oni ten model zkvantizujou a prostě místo 16 bitů je tam najednou 8 bitů a už to začíná být ta kvalita horší a horší. Hele, jak vlastně poznáš, který ten model potřebuješ ve smyslu, i ty rychlosti. Kdy potřebuješ rychlej, kdy potřebuješ naopak velkej. Jasně. No záleží, co děláš. Já to mám tak osobně, že malé modely, které jsou rychlé, které jsou méně chytré nebo třeba nemají reasoning, tak používám ve chvíli, kdy spravují workflow a to workflow je definované třeba nějakými skripty. Mám řadu skriptů, ty skripty se někam šáhnou, vezmou data, něco s těmi datami udělaj, jdej někam jinam. Je potřeba mít někde mezi krok, který bude buď spouštět, tu extrakci dát To workflow je poměrně jasně definovaný a není potřeba se moc rozhodovat, co a jak udělat prostě. Na tohle to ti stačí malinkatý model, který to dokáže chápat, který má nějaký skill, kde je přesně popsáno, co má dělat, spouští skripty, dělá věci. Nemůžeš od něho čekat, že bude rozumět x jazyků, nemůžeš od něho čekat, že bude mít vědomosti, že prostě bude... Takže se bavíme o angličtině primárně. Primárně ano, ale třeba DeepSeek podle mě zvládne 100 jazyků, a dozní hodně dobře a překvapně dobře zvládne i češtinu. Tenhle ten malinkatý model rozhodně ne, protože ten prostě těch parametrů má tak málo, že tam všechna ta slova v té češtině, jejich tvary a všechno prostě oložit nemůžeš. Kvantizací ta čeština jde dohajet. Ano, kvantizací jde taky čeština dohajet, tam se zmenšuje ta přesnost vlastně toho. No to je jedno, to bychom zabírali přiždy velký detail. Takže tenhle ten malý model použiju ve chvíli, kdy chci něco mít rychle a kdy nepotřebuji nějaké zásad by ten modeloval na nějaké workflow prostřední s tím třeba nějakého harnessu, který použije. Nebo použiju vision model na nějaký OCR, na nějaké popisy obrázku, prostě na vybírání obrázku a tak podobně, který je malinkatej. Příklad doma, teď padaly perseidy, bylo zatmění slunce, byl jsem prostě dvě hodiny, jsem ležel někde na Pálavě na tabulové hoře a měl jsem tam takhle zaplý foták a 20 sekundový expozice a přinesl jsem doma, doma je než 160 fotek. A viděl jsem, že na nějakých těch fotkách je Perseid pravděpodobně padající a taky jsem viděl, že tam je strašná spousta Elonových vláčků a že tam je strašná spousta satelitualeta. Tak jsem ty fotky vzal a říkám, hele, mám tady dýpsíka, dal jsem mu ten malej model prostě, dosova malej 4 miliardovej model QWEN 3 Vision. A řekl jsem mu, hele, tady je adresář, tam máš fotky v rozřešení 1200 na další stranu, najdi mi v těch fotkách Perseidy. A on se teda jako podíval, celý to trvalo asi 6 minut a řekl, tady na této fotce je Perseid a tím jsem si jasný a tady máš 15 fotek, na kterých by mohl být Perseid a nebo něco jinýho a podívej se. A když jsem se podíval, tak na této fotce opravdu byl Perseid, byl vlevo nahoře, takhle jako, jo, padal tam trošičku, fakt se mi normálně nepovedlo vyfotit, jedinou normální padající hvězdu. Hele, jsem na tom úplně podobně, teďka s pokusama, s Perseidama myslím zpátku. Takže to nemohlo trvat moc dlouho, to fotcení a sledování. Myslím si, že děti se jako tak po hodině vyčerpali a už potřebovali domů. Takže ve výsledku si myslím, že tam kromě putujících satelitů jako Perseid, tak i žádnej nebude na těch fotkách. Ale je skvělý, že, jak říkáš, tady i nějaký takovýhle malý model můžeš využít na nějaké škálování a vyhledávání, který potřebuješ udělat rychle. A pak to zase poslat dál a tam už přijde ten velký mozek. Takže bude zaostřeno jako technicky v pořádku, nesmí být úplně nějak strašně rozmazaná. Za druhé fotil jsem to na teleobjektiv a ostřel jsem na oči a na malou celonu. Takže budu je zaostřeno na ksicht, ale pozadí bude rozmazané, tak se nenech zmazt. Tím, že prostě lidi v pozadí budou rozmazaní. Za třetí neřeš nikomu moc hlavy a takový věci prostě. A za čtvrté jsou tam série těch fotek a já potřebuji, aby si to řekl, že série by byla to nejlepší a aby byl pokrytý celý ten koncert. Ale aby tam byly nějaké celky, aby tam byly všichni prostě a tak. 650 fotek. Čoč Martin do 12 minut vybral 20 fotek. Udělal jednu chybu, kdy vybral dvě fotky z série za sebou, což bylo proti tomu zadání. Ale jinak prostě vybral fajn fotky, které byly podle zadání, které bych třeba vybral taky. Já jsem ty fotky ještě neviděl. Já jsem viděl jen výběr toho modelu, takže nevím, co tam je v tom zbytku. Ale ten malinkatný model v kombinaci s tím dipsíkem to perfektně zvádl prostě. To je sen veškerých amatérských fotografů tohleto. Protože mě každý, když se se mnou jako s fotografem o něčem začne bavit, tak první věc je, že se mě ptá, kolik jsi to udělal dnes fotek? Já řeknu třeba 1500. A on řekne, ježišmarja, my jsme byli s Máňou nadovolený a vyfotili jsme 300 fotek. A už to jsou čtyři roky a nikdy jsme se tím jako neproberali. Takže tady to vybírání fotek, myslím si, že trápí všechny. Myslím si, že zas až tolik jako netrápí profesionální fotografii, který prostě to dělají na denní bázi, protože já už to je dost nekompromisně, jako jsem schopnej to rychle si tam bohu hvězdičkovat a tak. Ale stejně s tím strávím půl hodiny, hodinu jako minimálně nějakou přípravou, než se vrhnu do samotného zpracování. Přesně tak. A pro mě je schopnej některý věci jako pro mě vyretušovat, takže já už ani jako to nepouštím třeba do Photoshopu. Jasně. A třeba teďka jsem fotil nějaký portréty a pán měl jako na ruce velký tetování, který na té fotce mít nechtěl. Bylo s ním třeba 40 fotek a všechno to vyřešilo prostě kloz na banánovu za mě. Aniž já bych musel jako šáhat na Photoshop, což je jako úžasný a pro mě určitě velký zrychlení a o nějakým stříhání videa a tak, co jsme se tady bavili před natáčením, a ji nemluvě. Super. To je můj sen a tohle to chci mít rozjetí doma na lokálu. Prostě já chci tam mít nějaký ten editor, který má MCPčko nebo nějaký jiný způsob, jak ho ovládat. Prostě já chci, aby ho ovládal ten model. Aby mohlo tady udělat tyhle věci. Tam je trošičku škoda, nebo škoda, jako s tím ho asi nic neděláme, ale že ty generativní vlastně věci na fotovideo prostě potřebují strašně velký výkon na to, aby člověk to mohl rozjet doma si nějaký seedence nebo tu nanobanánu. Dostaneme se prostě na nějakých 80% třeba kvality tady těch modelů s něčím, co je volně stažitelný. A teď je otázka, jestli nám to bude stačit, kam to potřebujeme dostat, nebo nejenom. Já si myslím, že tady zase, jak jsme se bavili o těch harnessech, tak my vlastně nevíme. My víme, že máme nějaký endpoint, na kterém běží nanobanána, ale my nevíme, co je za ním. Tam bude nějaká sada nástrujů, která prostě bude pracovat s tím obrázkem, který tam pošleš a někdy něco udělá. Já si můžu představit, že tam bude jako řada modelů, který ten obrázek popíšu, prostě vydefiniuji, co se má stát. To určitě. Pak to pošlo nějakém specializovaném modelu, který umí vládat ten nástroj, který je na to vytrénovaný a ten s tím potom udělá nějakou věc. Takže určitě to bude trošku složitější a těším se, že tohle to jedná budu měnovat. Takže teoreticky prostě, kdybychom měli tu sadu nástrojů, k Já si myslím, že i s nějakým menším potom s obvolně dostupným modelem by se dostal na nějaké podobné výsledky. Tak to zní zajímavé, ale myslím si, že už minimálně spoustě lidí jsou udělali radost a i s tím protřídením fotek, protože jestli na to stačí i takhle málo paměti, co jsi zmiňoval, nějakých těch 6 GB říkal? Takže teorezicky, kdyby jsi to lokálně nainstaloval a propojil třeba s klódem, tak ti stačí malý předplatný vklóda, který je to na instruuje tady ten model a bude to třeba. Tohle je jeden z modelů, prostě pokud máš notebook, na kterým je nějaká 36 desátka, nebo počítač, na které je nějaká 36 desátka tajíčko, nebo něco takového. Nebo Apple, co nehrad slyšíš. Nebo Apple, ale Apple je úplně v hodě, já proti Apple nic nemám, jenom s nimi nemám zkušenosti. Já jsem párká pracoval s Applem jako z počítače v práci. Ale tady v tomhletom AI, jako lokáním nemám zkušenosti, jak moc nemůžu mluvit, ale vím, že ta komunita prostě dělá úplně neuvěřitelné věci, jak zmizeli strhu, jako studia Ultra 3, prostě 512 GB sdílené paměti. No v podstatě není nic, jen nějaký 2 GB verzi. Já jsem dlouho hledal, já bych si toho Maca, jako to studio koupil. Ty jsi dlouho hledal, já jsem dlouho čekal. Jo, prostě úplně bez problemu, protože 512 GB relativně rychlé paměti je dneska prostě neuvěřitelný. řešitelný množství peněz a za to zaplatíš dneska, já nevím, prostě 3,2 milionu, to je hrozný. Ale to se bojeme jenom o té paměti, všechny ty věci kolan, které potřebuješ k tomu. Takže vůbec Apple je úplně v pohodě. No a chtěl jsem právě říct, že když má někdo nějakou grafickou kartu, na který hraje hry, jako 30-60, klidně starou, dobrý, aby tam byla ta trojka na začátku, krama 8, 12, 16 giga paměti, tak už na tom opravdu dneska pustí model, který dává smysl a který dokáže prostě ov pracovat s obrázky, který dokáže pracovat omezeně i s videem, který ti prostě dá hodnotu a nepotřebuje žádný velký stroj. A k tomu se ještě asi dostaneme později, na co to spouštět. No a co ještě menší modely? Já jsem se tady díval, že Liquid AI vydali nějaký dvou a půl miliardovej model, který tvrdějí, že rozjedou i na Raspberry Pi, což jsou už takový věci, který by si mohl v podstatě telefonu rozjed dvakrát. Jako v podstatě na telefonu ano, já mám na telefonu nainstalované hned několik engineů, který dokážou spustit modely. Google vydal před nějakýma měsícema Gemma 4. Taky jsem zkoušel na telefonu. To jsou malé modely, tam je dvě a půl miliardy, tuším. Je to mixture of experts, což znamená, že ten model má sice dvě a půl miliardy a z nich aktivních je jenom menší množina. A to se dá normálně rozjed na telefonu. Já mám Samsung a Android, nemám teda telefon o teplu, ale na tom Samsungově mám Thermux, což je prostě Linuxový prostředí. A tam si normálně neinstaluješ jako llama.cpp, což je jeden z těch engineů, který spouští ty modely. A normálně tam pustíš model, ono to prostě jede a generují ti to 12-15 tokenů za sekundu. A ještě v tom Thermuxu je navíc API, který vidí na ten tvůj telefon. A vidí prostě senzory, vidí foťák, vidí SMSky a takovýhle věci. A ten model prostě ti může ovládat ten telefon. A ty mu řekneš, jako tady je telefon vyfoť fotku touhle kamerou, vyfoť fotku tamtou kamerou, podívej se na poslední SMSky, přeště mi co přišlo, pošli nějakou notifikaci do toho telefonu a tak. A všecko to běží na tom přístroji a máš prostě vyplý internet. Jo, a valí to. Jako opravdu se dejí dělat věci. Abych ti odpověděl, rozbry páj, jasně. A dneska je taky hodně, bohužel, jak proběhají různé války, hlavně ta na Ukrajině, tak dneska vlastně, vím jak já se zabývám i tím, že stavím drony, jako FPV drony a lítám se FPV dronama, tak bohu AI, které sedí na tom dronu, na nějakém prostě malém čipu. Může to být Raspberry Pi, může to být něco jiného. A prostě v té finální fázi toho úderu třeba pomáhá navádět na nějaký zachycený objekt, který to AI rozpoznalo, tak pomáhá navádět ten dron. Protože většinou v tom finále, pokud nemáš ten optický kabel za tím dronem, tak přijdeš o signál a tím pádem nevidíš ten pilot, jako nevidí, co se děje v brýlích. Takže už boužově i takovéhle použití. Ale pak je spousta robotů. Já promiň, že tě přerušuju, ale pomáhá to teda jenom u toho navádění, anebo to pomáhá třeba i pomocí umělé inteligence v rámci komunikace třeba více dronů jako zároveň? Nevím. Nevím, prostě bych kecal, vymýšlel bych si teď. Dobrý, možná pojďme o války. Viděl jsem swarmy, viděl jsem swarmy dronů, který tady teď se vůbec nebojíme o válce, prostě já viděl jsem jako swarm, který dokázal proletnout lesem a vyhnout se všem stromům. Na začátku toho lesa prostě bylo 15 dronů, na konci toho lesa bylo 15 dronů a takhle proletěli hustým lesem. Povyhýbali se, věděli, kde jsou všichni od sebe navzájem a skončili. Viděl jsem závody, kdy univerzity závodily s těmi nejlepší FPV piloty na světě, prostě kteří létaj jako největší, nejvyšší soutěž a jsou nejrychlejší. Na to se někdy podívejte, jen tak jako zlegrace, co to znamená FP závody. Není jak v autě třeba čas přemýšlet, že někam zatočíš. Tam se musíš všechno naučit. Namemorizovat takovou tu fyzickou pamětí, prostě kam pohnout těma páčkama a pak to udělat. A by to uděláš dobře nebo ne. A ty drony ovládné umělo inteligencí na tom dronu, nikoli prostě nějak pro planet bych dokázali porazit ty nejlepší piloty na světě a prolít na autotratě jako rychleji. Bylo to teda AI přes nějaký malý model, anebo to bylo jako nějaký strojový učení a rozpoznání? To je prakticky to stejné. Je to jako neural network. Protože ty musíš... ...protože další branka je někde tam. A teď ta kamera to vnímá a popisuje. A to vlastně vidíš teď na spoustě videí i z průmyslu, kdy je třeba AI, který má kameru a počítá brambory. Počítaj brambory nebo počítaj kuřata. Prostě dělají takovéhle věci a dokážou se zorientovat v obrovském množství těch objektů v jednom záběru 25 krát za sekundu. Prostě dělají takových objektů v objektů. Prostě dělají. Ale je tam kavárna, která se jmenuje AGI Coffee, kde mají lokální AI postavení, který serviruje DeepSeek. Když tam přijdeš prostě, tak tam máš jako endpoint a jako dokud konzumuješ jejich věci, tak si můžeš napojit prostě svoje aplikace jako na jejich endpoint. Tak jak dřív bývali Wi-Fi, tak teď možná budou jako model. Já nevím. Tady už v Brně nám servirují kafe roboti, tak kam se to posouvá? Těžko říct. No asi největší úlet ještě k tomu jako onboard AI, který jsem viděl a byly prostě vypálený modely, na čip přímo, který dokázali generovat třeba 16 tisíc, 40 tisíc tokenů za sekundu. Přímo na čipu prostě s procesorem, s nějakou pamětí, vypálený model, jednoučilovej, samozřejmě už s ním toho moc neudělat, když tam jedno vypálíš, ale brutálně rychlej prostě. A pro takové ty robotické použití, pro ty stroje, který jsem si musel rozhodovat, jako ve zvonku v tereny, si myslím, že tohle je cesta, kterou taky uvidíme v budoucnu. Dobře, dobře. Tak já se začínám bát, jako hlavně dronu. No to si bohužel myslím, že zrovna automatické zbraně jsou jedna z věcí, které bychom se bát měli. Dobře, když vidíš takový ty psy robotický, prostě s těma přidělanými samopelama na zádech, který se nebojí se běhnout. Radši to nesleduju. 50 stupňový kopec, to je hrozný. Ale budu tady mít Martina Krčka, který má Unit 3 robota tady v Brně a budem si povídat o robotice, tak to se těším. Možná se dostaneme v takovémhle trošku hrůzném vizím. No, když se vrátíme zpátky k tém modelům, který jsou open source nebo open waste nebo whatever, pod jakou licencií, tak vlastně se k ním vrátila i Meta, která vydala Muse Glimmer. Je to tak. Na to se zdíval? Jasně. Meta všechny překvapila, protože všichni mysleli, že Meta to zabalila. A přitom Meta v minulých letech dodávala prostě opravdu dobré modely, které dlouhou dobu byly nějakým etalonem. Prostě těch větších 70 miliardových modelů a tak podobně. Oni mezi tím přetáhli dost zajímavých lidí taky? Je to tak, ale odešel ten Jan Lecum, ten původní člověk, který to tam stavěl vlastně, což byla LK Strata. On totiž věří, že budoucnost těch modelů není tady v těch generativních modelech, jako v těch textových LL modelech, ale že je v těch world modelech, který se pravdu vyznají v tom světě, a nedokáže chápat a dokáže si spojovat souvislosti trošku lépe, nejenom nějaké textové. No, Meta překvapila. Glimmer není špatnej. V benchmarkcích se jako neumístil úplně na prvních místech, mezi těmi open weights. Na druhou stranu to jako vůbec není model, který by tě nějak zásadně zklamal. Já jsem si ho nainstaloval, nechal jsem ho zprovoznit, chvilku jsem na něm běžel Hermes Agenta, nějaké úpravy malinkaté, protože tam byly nějaké problémy s voláním toolů a různých věcí. To je to, o čem jsme se bavili předtím, že ten model se musí vyznat jako i v těch workflows prostě a dokázat udělat x kroků. Ale vůbec nebyl špatný, byl naprosto v pohodě a na úrovni Google Gemma 4, trošku možná horší. Vlastně fajn model. A všichni byli rádi, že Microsoft to udělal, že to Meta udělal a tady to LL. Napsanej, že to stáhne z 55 tady u toho modelu. Takže to člověk je docela schopný narvat i do počítače, který nemusí úplně oplývat nějakou velkou pamětí a může ho člověk jako provozovat na relativně levným počítačí. Ale je to tak. Spustíš to pravděpodobně na stroj, který má 24 GB grafické paměti. S tím, že 4-bitová kvantizace možná nebude stačit, takové 3. A nebo laboratoře jako Anceloth prostě dělají neuvěřitelné kvanty, které prostě dokážou zmenšit ještě z těch 20 třeba na 17. Což už ti dá potom další 3 GB paměti na to KV cache, na ten kontext. A to už je jako fajn. Já tady teď mám před sebou notebook, který jsem si koupil, který má v sobě Nvidia RTX 5090 s 24 GB pamětí, protože ta notebooka bohužel nemá 32 GB, a mám tam prostě x modelů, který jsem schopný pustit s kontextem od 96 do 256 tisíc tokenů, a který valí. Který valí prostě 40 tokenů za sekundu, který dokážou udělat spoustu práce, dokážou to udělat prostě na tom notebooku. Bohužel, to teda notebook z Windows, Windows dokážou zabít. Tady tyhle věci je naprosto spolehlivě. Pro jakoukoliv lokální je, potřebuješ Linux, nebo Mac OS, ale Windowsů jakož ale pořád prostě na Windows to pustím a pořád to jako jede, má to přístup k mému počítači, dokáže to prostě ten počítač ovládat, dokáže to s ním dělat různý věci. Já jsem s ním na začátku problémy, protože mi to padalo na modrých obrazovek, protože tam byl nějaký špatný firmware od ASUSu a on mi to celý zdiagnostikoval, prostě ten model, prohlíd do všechny logy, crash logy, udělal tohle, napsal správu, prostě řekl, tak máš správu, tak máš prostě, tehdy se to stalo, tehdy se to stalo, tolikrát se to stalo za poslední měsíc, stalo se to ne do nějakého S8, mama se probudí do S0 a už se to nestane prostě, je tam nějaký timeout, prostě 3 sekundy přesáhne to na zdar, modrá obrazovka. Jo, tady to máš, tak kdo to pošli do servisu prostě s tou spráhou. Malý lokální model, který ti voláda Windows. No já bych chtěl naše posluchače jako na to trošku namotivovat, aby se nebáli to zkoušet, protože sám jsem se do toho neponořil zdaleka jako ty, ale i prostě na nějaký maličkosti, jako je převod hlasu na text, nebo opačně textu na hlas. Nemá cenu prostě v dnešní době na to zbytečně jako utrácet peníze a ty malý modely na to existují, běžejí na obyčejných strojích a může se s tím člověk jako vyhrát a myslím si, jak zříkal i právě na takový ty rozstřídění věcí nebo třeba nějaký research, na který člověk nečeká, jako nepotřebuje okamžitě a můžou mu běžet někde přes noc, tak jsou to jako zajímavý tooly, který stojí za to vyzkoušet. Naprosto, no, mě vlastně někdy konce minulého rukou mi strašné štovalo, že do toho počítače jako všechno píšu, že tenkrát ještě cloud, který jsem používal nejvíc ze všeho, tak neměl podřežení mezerníku na hlasové diktování a tak jsem si prostě k tomu cloudu jednoho krásně odnesel a říkám, ale chci nativní Windows aplikaci v dotnetu, která prostě bude využívat grafiku, která tam je a když zmáčknu control mezerník, tak mě bude poslouchat, já budu mluvit, ono to detekuje jazyk a tam kde mám Cursor, tak až zase zmáčknu control mezerník, tak tam vloží to, co jsem řekl v tom jazyce. Já od té doby mám tu aplikaci prostě a je jako naprosto super, je tam malinkatý modílek, který když to zapnu, tak se načte do té paměti prostě, když ta aplikace detekuje, že tam není grafika, tak se načte normální ramky a používá normální procesor, je to trošku pomalejší a když tam je grafika, tak prostě se načte do toho GPUčka. A používáš Vispr nebo používáš jaký model? Jo, je tam faster Vispr, myslím, je tam faster Vispr a taková ta medium, medium a small kvalita, která úplně perfektně stačí na angličtinu a češtinovi. Já jsem na tu češtinu totiž vždycky používal, tu největší vlastně, která má asi na půl giga, že mě asi blbě mluvím, přišlo na to, že to v těch menších modelech neprojde dobře, ale je fakt, že já to používám všechno v češtině a s tou češtinou je vždycky to jako složitý práce. Požívá hrozně málo lidí, takže mě vůbec překvapuje, že tolik model má pro ní podporu. Ale já tam mám drop-downe, tam mám možnost vybrat všechny ty čtyři velikosti těch modelů, takže když se snažím něco říct a ten model to prostě nebere, tak si otevřu tu aplikaci, to já ji řeknu, ale načí tady tenhle ten model, on to načte a pak zkouším ten vyšší. Jako od těch cloudových modelů, který některý ty slova se snaží poupravit, ale s tou češtinou je to jako fakt složitější. Je to tak, no. Když jsme ještě u toho glimru od Mety, tak tady mám takovou poznámku, že Zuckerberg tvrdí, že učit se zpozorovaného je legitimní princip, což mě přišlo takové hezké zvolání ve smyslu toho vlastně všechno můžeme skopírovat, cokoliv uvidíme. Co si o to myslíš? Já se o to myslím, nebo odpovím ti otázku, kdyby jsi měl jedno z největších sociálních sítí na světě, která má svůj biznis postovaný na tom, že obchoduje se za ty lidi, kteří zadarmo tu sociální sítí používají, tak bys to netvrdil. Tak je vlastně dobré všechno vidět a z toho se užít. Oni o tobě ví tolik věcí, o tom, co děláš, prostě přes ty navázný reklamní IDčka, jako z jiných systémů a tak, že prakticky to musí říct. To je asi fairovalo tvůj. - A co se dnes dva týdny nejvíc překvapilo a co z toho reálně začal používat? - Musím říct, že mě teda nejvíc překvapil ten DGX Park, ten VD a ten stroj. Já jsem si dva koupil, respektive tu vám verzi od ASUSu, ASUS Ascent GB10. Já jsem o tom hrozně dost dlouho přemýšlel, jestli si ho mám koupit nebo ne a měl jsem obrovskou výhradu k tomu, že tam je nějaká unifiková paměť, která je relativně pomalá. Ona má pro postaci 273. 273 giga za sekundu. 273 giga za sekundu je hrozně málo jak na perfil, jak na zpracování promptu, tak na generování. A čím máš větší model, když používáš takové dance modely, kde se aktivuje každý ten token, který tam je, tak tam se děje neuvěřitelné množství operací prostě za sekundu, který to musí udělat, aby to vygeneroval ten jeden token. A ta paměť působila tak, že prostě není možné, aby to bylo použitelně rychlé, ty modely. Ale protože jsem členem komunity to je těžší lenců kolem lokální AI. A jsou tam naprosto neuvěřitelní lidé, kteří prostě dokáží za den, dva od vydání upravit ty kernely těch engineů, který ty modely servírují takovým způsobem, že zvýší rychlost ze sedmi tokenů na padesát. Protože zjistí, že někde se něco nedělalo, někde se něco dělalo, jinak někde se něco aktivovalo zbytečně prostě víckrát v tom kernelu. Oni to proskomají, proščourají a přepíšou. Já jsem se toho jednou taky zúčastnil, kdy prostě jsem si pustil to GLM 5.2 Další čínský model. Další čínský model a další obrovský model, prostě jeho 470 miliard parametrů. To znamená, i když jsem ho měl v EQ2, to znamená ve dvoubitovým kvantů, tak ten model měl pořád 250 GB na disku. Já mám tu svoji kudničku na tokeny, co jsem si postavil, tak tam jsou 4,30, 90, takže ty mě dají 96 GB verem a mám tam 256 GB v romání DD a 4 paměti. Takže části v kartě a části prostě v té normální ramce. Offload. Dával strašně blbý čísla na výkonového, na decodu, na generování dával prostě třeba 7,5 tokenů za sekundu, což je fakt nepoužitelný. A při zpracování toho promptu dával třeba 50 tokenů za sekundu, což je ještě méně použitelný. A tam potřebuješ tisíce nebo stovky vyšší minimálně, aby to bylo trošku svižný. No a tak jsme si sedli jeden večer a moc jsem toho nenaspal, ale prostě jsem vzal llama.cpp, jeden z těch engineů, který servirujou, Prošli jsme to a zjistili jsme, samozřejmě s pomocí umělené inteligence, že tam je nějaký problém, že prostě jeden z těch kernů, který něco zpracovává, který dělal ten prefil, tak to posílal postupně do těch grafických karet. Takže to posílal do jedné grafické karty, on se zpracoval, pak přes PCI do druhé grafické karty. Ta PCI je hrozně pomala oproti té grafické kartě. Takže tam bylo 50. No a vlastně po té noční seanci ten prefil byl 530, 600 tokenů za sekundu. Desetinásobně rychle. To jsem dokázal udělat i Ahirka, který neví program který prostě o tom prakticky nic neví, jenom s pomocí tého měla inteligence. Takže ta komunita dělala obrovské věci a mě prostě překvapilo, když jsem si koupil ty dva Sparky, respektive ty dva Scenty a postěl jsem na tom ten DeepSeek V4 Flash 0731, to poslední verzi, že mi z toho leze podle toho, co dělám, třeba 80 tokenů za sekundu, prefil je brutálně rychleji, 1500-17 tokenů za sekundu, je to v kvantizaci NVFP4, což je vlastně komperse, a samotná Nvidia pro ty svoje grafické jádra Blackwell, které jsou tam, je tam Blackwell GB10, Grace Blackwell 10, je to přímo pro mě dělený, optimalizovaný a prostě to valí a teď mám jako neuvěřitelný model, který dokáže udělat prostě třeba 12 paralelních streamů a když má těch 12 paralelních streamů a se ještě všechny ty tokeny, který dá, tak dává třeba 300-400 tokenů za sekundu, a když je single stream, ale je paralelní, tak mě dává 80 nebo 50, podle to, jak má zapněný kontext. A kontext je tam mimochodem milion, což já nikdy na nic jako nepoužil ten milion, bych se musel s tím agentem bavit prostě půl dne, no tři čtvrtě dne nad jedné sešny. Takže mě velkým způsobem překvapilo tady tohleto, protože jsem tím počítačem tak nějak jako nebyl jsem si s ním jistý, myslel jsem si, že to prostě nemůže být na reálnou práci použitelné, že vlastně jsem to kupal i s tím, že to třeba vrátím, že to je hrozně moc peněz. A nakonec jsem strašně rád, že to mám. Ta věc žere v klidu 14 vatů. Protože když jsme se před časem bavili o tom, kolik žerou ty grafické karty v tvým druhým počítači, tak jsme došli k hodnotám blížícím se rychlovarný konvici, která je puštila neustále. A tak tohleto prostě pro ty firmy, nebo firmám to více může být celkem jedno, ale takový načencům jako seš ty, tak to ušetří už je spoustu peněz na elektřině. Takže jsem si připojil chytrou zásuvku a zeptal jsem, že to žere, když je to idle, když to leží na stóle, nic to nedělá, tak si to bude 230 vatů. To je pořádná televize. To je schopná to vytopit o 2 a 3 stupně, jako oproti tomu, co bylo venku. Tak v zimě se to hodí, ale v létě jako bych to nechtěl. Přesně jak říkáš, oproti tomu ty ascenty idle 14 vatů 1, takže 28 vatů 2 a když jedou na plný výkon, tak 130 vatů 1. To je krásně. Ještě, aby si naši posluchači dokázali představit tu velikost těch velkých modelů, kolik tak zhruba bys potřeboval takovýhle karabiček na tom, abys na tom rozjadřila toho novýho Kimiho? No, tak Kimi 2,8 trilionů, tak kdybys to skvantizoval na půlku, tak potřebuješ 1,4 terabajtu paměti jenom na váhy. Takže to je FP8. To máš jako nějakých 12 kusů a pak potřebuješ brutální množství na kvc na kontext. Takže třeba 15, 16. Ale problém ještě je, že ten model, jestli se nepletu, tak má aktivních nějakých 100 miliard parametrů. On je jako natrénovaných, celkový počet parametrů, který má taky docele 8 trilionů, ale aktivuje jenom 100 miliard, tuším těch parametrů. A těch 100 miliard už je tolik, že ten Spark by to nedal. To je početně. Je prostě tak moc výpočetních operací, který on musí udělat, aby vygeneroval ten jeden token, že by se dostal někam na 2, na 3 tokeny za sekundu. Na nějaké nepoužitelné věci. Takže tady pravděpodobně... Tam jsme prostě v nějakém datacentru. Jseš jako v datacentru, nebo seš v kombinaci nějakých 4 brutálně rychlých grafických karet, který tě jde dohromady 400 giga paměti a nějaké ramky 700 a kvantizaci dvoubitové, která to stáhne prostě na pětinovou velikost, ne na polovinu, ale... Mně posluchače 10. Mně úplně stačilo, když jsi říkal, že ty dva Sparky propoješ kabelem, který samotný stál 6 tisíc. Jo, jo, je to tak. To mě teda dostalo, protože za kus káblíku půlmetrovýho, jako zaplatit 6 tisíc. Je to takový solidní měděnej kabel, jako tlustnej, ale ty karty, který propoješ, tak mají rychlosti 20 gigabitu za sekundu. Naposledy, když mě fascinoval nebo šokoval nějaký kabel, tak to byl kabel, co měl pán jako nataženej v audiosestavě, jako od televize do jeho nějakýho receiveru a byl nějakej, nevím, jestli byl celý zlatej nebo zlacenej, ale každopádně ten kabel stál čtvrt milionů. No jasně, no. Takže, jako chápu, tehdy jsem pochopuji, že kabely můžou být drahý, ale i těch 6 tisíc, jako za propojení dva Sparky, mě přijde dost. Je to tak. Já jsem se chtěl ještě trošičku zastavit u těch open source věcí, protože open source není vždycky, jako neznamená to stejný, každej si pod tím možná představuje trošičku jinak, máme tu různý licence atd. Tak nějak to zkoumáš dopředu, jako než si něco takového stáhneš, pod jakou licenci to běží, je to pro tebe nějak podstatný? Pro mě je to podstatné ve chvíli, kdy to začne instalovat klientovi, abych prostě klientovi řekl, tohle můžeš a tohle nesmíš. - Když máš open wait, tak to je většina těch modelů, těch reálných open source modelů. Já jsem napočítal asi osm. Open source model je model, k kterém dostaneš nejenom ty váhy, ten soubor, nebo tu řadu souborů na disku, a dostaneš nějaký recept, podle které byl ten model vytrénován a odfuntuningován, a dostaneš k tomu ještě dataset, na kterém byl trénován. Takže to jsou jako tři věci, a pak dostaneš licenci na volné použití k čemukoliv. - A takhle velký open source asi se týká jenom nějakých úplně maličkých věcí. - Jsou to většinou malé modely, neznáme prakticky. Jako teď, nějaké LFM, 2,5 tuším, jsem se díval, ale je jich opravdu málo. Open wait modely, ty si stáhneš prostě na Hugging Face, mimochodem, kdo neví Hugging Face, naprosto bombastický web, Huggingface.co. - Myslím si, že po posledních hackerských věcích, který tady předváděli velký modely už z Hugging Face, naprosto, kdo? - Je to tak. Takže open wait, snahneš si váhy na svůj disk a pustíš to na své grafice, ale teď jako pozor, teď jsou tam různé licence. Apache, Meet, prostě všechny možné. Některé ti umožňují používat komerčně ten produkt, jak chceš. Některé říkají, používaj ho komerčně, ale jakmile vyděláváš na 20 milionů dolarů, tak prostě nám budeš muset zaplatit za to. Některé, jako třeba teď Minimax H3, říkají používej ho, ale ne v Evropské unii, a ne někde jinde, v Severní Koreji, myslím. A ještě někde prostě. - To jsme blbíška tulce tedy. - Ale ty evropské regulace tomu úplně nepomáhají. Ale oni vlastně mluvili o tom, že to zvednou, tady tu restrikci a časem prostě, že je potřeba jenom zjistit, jak je to může mít jako legální dopady za nízka různých GDPR a podobných věcí a toho vlastně evropského AI aktu, který začal platit přednadávně. Takže těch licencií je řada typů a nějak tě omezují a nějak ti říkají, co s tím můžeš dělat. Takže je dobrý vědět, že tam nějaká licence je a podívat se, než to strčím do firmy, která prostě vydělává 4 miliardy ročně, že to tam strčit můžu. Praktické by ti potom nepřišla. Nějaká kontrolova řekla, vy tady máte modelky, na který máte licenci. To bych se úplně nebál, že se u nás bude dít, ale... Ale děje se to. Já jsem byl strašně překvapený, ale minulý týden jsem se bavil s kamarádem, kde prac Firma je nadnárodní, v Evropě má obrovské obraty a krom toho, že prostě zaměstnancům dali oklody a všechny možné, podle to, jak jsi vysoko v potravním řetězci, tak si dostali nějaké předplatné, tak si teď koupili vlastní hardware a normálně tam servírují kvena, servírují tam tady tyhle ty věci a ty zaměstnaci to můžou používat, je to takový vlastní laboratoř. A někdo to kontroluje, jo? No zatím asi ne, myslím si, že Česká státní zpráva zatím nemá moce ponětí o tom, že by mohli vůbec sebe. Že něco takového existuje. Ale jo, tak já chápu, že asi bychom ty licence měli číst a měli bychom se... Každé tímží ujednání bys měl přece přečíst. Já nevím, co děláš ty jako večer, ale já si šli ty 300, 400, 500 stranek malým písmem. Já to dám do kloda a napíšu mu, je to průšvih, není to průšvih. Na co si mám dát pozor, jo? Na co si mám dát pozor a pak to ignoruju. No, další otázku tady, pro tebe mám ještě, která na to trošku navazuje, protože, jak jsme se bavili, nevždycky otevřené znamená dostupné. Ve smyslu toho, že může to být otevřené, můžeme si to stáhnout, ale potřebujeme na to nesmyslný obrovský stroj, na kterým bychom to museli rozjíždět. Takže možná ještě bys mohl našim posluchačům třeba tip na to, co na běžným počítači, teď řeknu, já jsem Appleista, zarytý, tak řekněme, že prostě mají doma nějaký MacBook, který má 32 GB ramky, tak co třeba bys jim doporučil na tom rozjet za jeden model nebo kombinaci modelů. Jasně. Tak, nepsaným králem 32 GB paměti je model, který se jmenuje Kven ve verzi do nedávna 3.6, teď už 3.8, ta vyšla v pátek, byla událost naprosto neuvěřitelná, se prostě online spacy startovaly na X a tak, ta komunita byla hrozně natěšená na ten model, protože ten model je neuvěřitelně dobrý. To je 27 miliardový model, který je teda hustým a všechny 27 miliard prostě aktivuje při každém pasu, ale i na takhle omezeným hardwareu dokáže jet relativně rychle, lepší je mít grafickou kartu, protože i tam má paměť má omezenou propustnost, tam se budeme nějakých 460 miliardový. Záleží na modelu. Čím větší ta propustnost je, tím je tako lepší. U těch grafických kart se bavíme o tom, že 3090ka z roku 2020 má tu propustnost 960 miliardový. 5090ka má 1,9 a tak podobně. A tam už tam seš prostě úplně jinde. Tam je ta cena taky, kterou za to platíš. Ale Kven ve verzi 3.6 teď 27 miliard parametr 27b. Naprosto super v kvantizaci Q4 od Ancelot. Paráda. Kven ve verzi 3.6 ještě udělal takzvaný Mixture of Experts. To je model, který má asi 35 miliard parametrů, na kterých je vytrénovaných. Aktivují se jenom čas. Aktivují se jenom 3. Vždycky v každou chvíli. Tam je takový speciální router. Modela se skala je takový hladin. Ta hladina každá má jako router. A ona zpracuje ten prompt. A teď se jako podívá, co se tam dostalo za věkně. A pak to narutuje do nějaké další hladiny. Kde běží ty 3 miliardy těch aktivních. Mysletě 35 miliard. A tak se to stane 40krát. Ještě z toho vypadne ten výsledek. Je to rychlý. A je to dobrý. Prostě je to kvalitativně velice dobrý. Je to podobný tomu 27 miliardovému modelu. A pořád tam platí to, že ale ty potřebuješ tu velkou paměť na to, abys to tam narval celý ten model. Ale pak to běží rychle díky tady tomu Mixture of Experts. Je to tak, je to tak. Potřebuješ méně paměti na KVCash, na ten kontext. A běží to rychle kvůli tomu, že to počítá mnohem míň. Desetkrát míň to počítá. To je celkem trend, jak se to posouvá tady u těch lokálních modelů. Ty obrovské modely jsou podle mě všechny. Takže na 32 GB bych doporučil tady tyhle sty. Nebo Gema 4 od Google, kdyby někdo neštěl činěná. Je trošku horší ve statistikách benchmarkcích. Ale je furt jako fajn. Kdybyš těl někdo vyloženě evropské modely, tak Mistral. Já jsem si říkal, jestli vůbec o něj zavadíš. Protože my to tady často pomlouváme. Já mě už trošku se cítím tak jako proviněle učitou Mistralu, že tady od nás schytává jenom hejt. No to je totiž strašně smutný příběh, protože na jednu stranu ti vystoupí, jako Uršula řekne, we will be the first AI continent. A pak zjistí, že největší evropská AI laboratoř má na další tři léta provozu 20 miliard euro. A jedna prostě z těch velkých amerických, těch 20 miliard euro má jako na co na dva měsíce, nebo na měsíc, nebo na něco takového prostě. Takže Mistral je bohužel hodně po zpátku a hodně zpět proti tomu, co umí ty Open laboratoře. No a teď před pár dnes jsem teda slyšel poměrně smutnou zprávu, kdy Mistral řekl, že bude věnovat část tvojí početní kapacity na to, aby hostovali teda ty čínský Open modely. A budou je poskytovat jako do evropského prostředí, tak aby plněli všechny evropské regulace, to znamená prostě nějaké uzavřené cloudy, kdy ty evropské data nepůjdou pryč. Ale mám takový pocit, nevím samozřejmě, jestli je to pravda, je to mý pocit, že oni to trošku zdávej. Že prostě ví, že... Ono je to samozřejmě smutný, ale jestli to není cesta... Teď neříkám pro Mistral, ale pro nějakou evropskou firmu, vzít si opravdu to, co udělal Cursor s tím Kimi 2.5, vzít si nějaký super čínský model, přetrénovat to na našich datech, vyladit to pro naše evropské použití. Ať tady máme aspoň něco, co poběží v rámci EU, bude to splňovat veškerý náležitosti. Myslím, že to je... Je cesta, nebo... Já se bojím, že to bude jediná možná cesta do budoucna a opravdu budu rád, když se nestane ta špatná varianta, kdyby ta Čína prostě začala limitovat vývoz tady těch modelů, nebo jich nasazení a... Jsme tak hezky přešli, tady já zrovna jako na to mířím taky, že si se o tom pobavíme, protože v polovině července oni si v Pekingu pozvali lidi z Alibaby, ByteDance a ZAI a řešili to, s ním má jejich ministerstvo obchodů, jestli to prostě nějakým způsobem nezregulují, jestli nedojde k tomu, že jenom ty méně schopný modely budou pouštět takhle jako open source do světa a jestli ty nejlepší věci si úplně nezamknou v rámci Číny. Do toho z druhé strany Amerika řekla, hele, co kdybychom ty čínský modely zakázali, to se tam nikomu nelíbilo, protože na to jede polovina Ameriky, že? On veli jede na čínských modelech, tak začíná to být fakt jako už takový vyostřenej střed tady těch mocností a do toho zase ještě velký americký modely, který taky američani začínají trošičku se o ně starat a ve smyslu, jako budeme to brzdit, jestli to není zase až moc schopný, aby to třeba někdo rychle neokopčil, nebo to nepoužil vlastně proti nám. Tak co si myslíš o ty geopolitický válce modelů? Má hrozně moc rozměrů a já si vůbec netroufám, ale můžu říct svůj názor. Takže pravda ta obchodní válka mezi tou Amerikou a tou činou je naprosto jasná. Tak to už kdyby žijí daleko, něco to předilo tady do toho, že? A AI v ní bude hrát zásadní roli, protože schopná AI bude urychlovat vývoj, produkci, psaní softwaru. Prostě ta schopná AI způsobí, že firmy, které budou mít a budou ji moc využít, tak dodají svůj produkt v nějaké kvalitě na ten trh mnohem rychleji než ty ostatní a za jinou cenu. A schopná AI, která ještě se dokáže jako rekluzivně sama sebe zlepšovat a trénovat, což je teď prostě trend, který se už děje a která získá schopnosti na poli kyberbezpečnosti, tak se stává prostě globální zbraní v tu chvíli. Ty jako national state můžeš prostě říct, pojďme pustit tady to naši AI všech systémů, kam máme prostě pomocí našich tajných hacků přístup a pomocí exploity a pojďme ty exploity využít a pojďme tamhle hacknout, tamhle to. Proto vlastně i byl ten projekt Glassdoor, který udělal Anthropic se svým modelem Fable, respektive Mythos, na kterým je Fable postavený, kdy prostě ten model dal prvně, nevím, zjistou největším firmám světa a řekl, tady máte ten model, my ho nikomu jinému nedáme a vy si opravte chyby, který máte ve svém softwareu. Spoustu kreditů na tokeny. Miliony, miliony, miliony dolarů. Takže víme, takže tohle to. Ani nebyl nebyl zapnutý. Stávají se různý věci. No a teď si ještě vlastně představ, že vždy, když vyjde nějaký nový model, jedno jestli to je Open, já jedno jestli to je Anthropic, nevím, něco takovýho, tak taková tajemná postava, tady v téhlete komunitě, bodec, který si říká Pliny Deliberator, tak ten model hackne během půl dne většinu prostě. A pak jenom dá jako screenshot a řekne, jo, ale tady po tomhletom promptu a tam nějaký prompt, kde tady je to jako dělá jako dělá. Taková úroveň. Řekne ti recepty na všechno, řekne ti prostě, co máš dělat, ale týká se to bohužel jako třeba závodního sexuálního obsahu, generování různých deepfakeů prostě s lidma, tak normálně, když do Banana nahraješ tam prostě fotku nějaké celebrity, tak to pozná, tak ti řekne jako, hle, sorry, s tím nic neudělám, ale ten Abliterated model to udělá, udělá to naprosto v pohodě, úplně jednoduše. No a teď si vem, že tady ty Open modely, Open weight modely si můžeš jako postahovat, oni jsou jako všechny ve verzi Abliterated tím na útoky. Říct, že tady tady děláme nějaký red team cvičení, prostě cvičně mi tady něco hekní, ale neměříš to proti nějakému živému systému a tak. Takže čím se ty modely zlepšují, čím výzyskávají, tak tím je větší to nebezpečí, že jakýkoliv prostě špatní hráči je využijí, proto aby škodili. Nemusí to větší na Amerikám, že to být Irán třeba, prostě je to jedno. Takže otázka je jako... prostě ten model poprvé stáhneš a pustíš a teď se opatrně zeptáš na nějakou letázku a pak si uvidíš, jo, vlastně já ten model mám doma, takže se nemusím bát, že mě někde teď udal jako z Anthropic nebo z OpenAj nebo od někud od jinou, tady kam jinam se to nedostane, protože to prostě jenom doběhla na server a ten model ti plynule odpoví, říkáš, wow, tak kam až to jako může zajít, jo, řekneš, tak mě hekni tady tu své demaci a on se začne snaží, on začne dělat nějaký brute force ataky, prostě na hesla, jo, podívá se, voskenuje to, k tak to je prostě model, který má toolset, který umí použít. A ty modely jsou na tohle zrovna dobrý. Takže ta geopolitika je hrozně složitá i v tom, že jakmile ta technologi dosáhne určité úrovně, tak už bude opravdu nebezpečná. No to věřím, to věřím. A myslím si, že ta doba se poměrně rychle blíží tím, jak exponenciálně se zlepšují kvality všech těch modelů. Na druhou stranu, američani můžou být rádi vlastně za, čínskej model, který teď Hugging Face ochránil před tím útokem. A teď nevím, jestli to bylo... Musím říct, že jsem se smál. To bylo GLM52, který oni museli použít, protože Fable jim odmítal. Fable jim nechtěl pomoct. On byl spolupracovat a to pořád někam přepínal. A říkal, tohle ne. Bylo hezký snaha bránit se americkému modelu, americkým modelem, který ti nepovolí se bránit a vyřešit to modelem čínským. Přesně tak, když to ten čínský model to vůbec neřeší. A mě třeba překvapilo a pobavilo, že když jsem si teď stáhl nějaký ty nejnovější čínský modely, ten dý psík je tak, aniž by byly odemčeny a byly terated. Tak jsem se to model zeptal, komu se v Číně říká medvídek půl a proč. A ten model mi to normálně řekl, je to handlivé označení pro si Jinpinga, jak mi se to objevilo, tak to začala čínská strana cenzurovat. Je to zakázaný všude na firewall, tohle si to požívat si to nesmí. Ale jinak normálně medvídek půl je úplně v pohodě. Prostě postavička, tohle je jenom v tomhle kontextu, je to zakázaný v Číni. Zajímavý. To ty první modely vím, že to odmítali říct. A ono možná ten nějaký bias tady těch, nechci říct propagandy, ale že jo, prostě tam se drží jiná linie věcí, co je potřeba do lidí dostávat, tak je asi hloub. A trošičku jinak tam poskládá, než na takovýhle na první dobrou otázky. Ale bohužel nejenom v Číně. Jo, tak to jsem nedávno viděl analýzu velkých modelů západních a byl tam takový ten klasický kvadrant, to kam se ten model přiklání. Liberál, pravicový, levicový, tohle, tohle. A člověček krom groka, který byl neutrální, ty modely jsou všechny hodně doleva. Až si říkám, že to možná není úplně dobře, protože... Jo, byly tu i analýzy třeba, jak moc jsou zasaženy nějakou ruskou propagandou. Jasně. A takovýma věcma. To je to otravování těch dat, na kterých se trénuje. Stačí vytvořit dostatek kontentu na internetu, který potom ty skrypry natáhnou. Bohužel samozřejmě Mistral dopadl strašně špatně tady v tom, ale taky jsme to tady... Já jsem se díval na nějaký ten index, nějaká ta firma, která řeší tu bezpečnost číslo těmi dotlivými modelůmi. A tam je to strašně zvláštní, protože oni vlastně neřeší fakticky bezpečnost toho modelu. Oni řeší zabezpečení uvnitř té firmy a nastavení procesu, který mají zabrání tomu, aby ten model byl škodlivý. Takže oni vlastně řeší nějaký procesní audit v té firmě. Spíš neže by řešili, jak dopadl ten model. Takže je to taková jako spíš byrokracie. No. Aby jsme neskončili nějakou takovouhle... Těžkým tématem. Tak co třeba ty a nějaký digitální detox? Já se na to ptám většinu našich hostů. Jak moc se od toho snažíš odpoutat a všechno povypínat? Nebo najít si nějaké místo, kde tě tvojí agenti nebudou otravovat? ještě běhat kolem toho duma. - A u toho vypnuš? - Na nějakým stroji a tak, a u toho krásně vypnu. Pustím si prostě metaliku, která je trošku tvrdší a zvedám činky, je mi dobře, jakože nepřemýšlím. Ale pravda je taková, že jsem měl v pátek buknutý slot v posilovně a zrovna prostě na tu chvíli, kdy vycházel ten kvent Triosu, říkal jsem si: "Ty jo, nedalo se." - Já bych chtěl být radši u toho počítače, než jí do té posilovny. A posledně jsem říkal: "Ale, moment, mně tady běží Hermes agent." Počkáš, až bude stažený, dáš ho tady do toho adresáře, pak si na mým disku najdeš skripty, kterýma se spouští podobné modely, přepíšš ty skripty, vytvoříš novej, pustíš to, jestli to nebude fungovat upravý skript, podíváš se do logu toho servoru, co to serviruje. Až to budeš mít hotový, tak mi pošleš na Telegram zprávu, že to je hotový, že ten model běží. V půlce sešny, přišla zpráva na Telegram, tak ti jenom chci říct, že tady běží model, že jako v pohodě. Byl tam jako nakoplej ten Kven Mě moc baví fotcení, už hrozně moc let. Hrozně ne na tvé úrovni, ale prostě rád fotím. To bych úplně netvrdil. A tak jsi skvělý fotograf. A tak tam je to ten digitální detoxen z půlky, protože přesně tak jsme se tam bavili, pak přijdeš k tomu počítačku. Musíš vzírat do té obrazovky strašně dlouho a upravovat. No a hrozně moc baví jistavě drony, ty FPVčka, už jsem o tom mluvil, a lítat s těma FPVčkama. Než jsem, budu ví, jak dobrý pilot, ale zase nejsem úplně špatný pilot. Tady si strašně užívám to, že prostě vyjedu někam do hor, když nasadím si ty brýle a prostě pošlu ten dron 6 km od sebe na nějakou jinou horu, která tam je, a pak si nám dvokilometrovej dive dolů. A vidím to v těch brýlech, jak kdybych seděl na tom dronu. Je to prostě nádherný adrenalin, protože se může stát pousta věcí a tak. Kolik se jich nevrátilo už? Hele, z těchto chvíletů se vrátily všechny drony zatím, oprav. Já zrovna jsem dneska vyplňoval reklamační formulář na dron, abych to poslal na opravu, protože mi tam ten gimbálek nějak zlobí. Zlobitě gimbálek. Tak s dronama je pořád legrace nějaká. A my občas natáčíme s kamarádem takové extrémní sporty a vědovnících, se jezdí ten Hydro GP, udalosti mistrovství světa, prostě těch rychlých lodí. Tam jezdí lodě, které mají tisíc kubických centimetrů motory, nebo dvanáct set a tak. To je prostě loďka, 160-180 kilometrů po té vodě, po tom rybníku a ty za ní letíš s tím dronem, prostě je to takhle celá voda a ty prostě se snažíš vyhnout a natáčíš a je to jako super. Tak tam třeba jedna lodně sejmula vyloženě průdem vody, ten dron, no jo, skončil jsem na dně rybníka s tím GoPrem a druhá, tam mi došla baterka, jsem to přehnal prostě, zase jsem skončil na dně rybníka s druhým GoPrem rok potom. No, takže tak, takže takový věci. Hezký, hezký. Už jsme tady měli všechno možné, tak ses přidal tady s dronama, to je takovou zálibu, tady ještě, ještě nikdo nezmínil, jako digitální detox, to je fajn. To je super, jako, víš, jinak šeft ještě baví, on třeba kamošekry má jako v chorbatsku továrnu na lodě, on dělá malý, rychlý speedbooty a třeba do luxusních jachet, máš velkou jachtu a potřebaš jako do boku speedboot, aby se mohl sednout v Monte Carlo a nedělal ostudu, když přijedeš a tak prostě každej rok tam zajedem a já se proletím za tou lodí, natočím nějaký záběry, prostě ta loď taky jako jede kilo, možná více, možná více, a ty zatím letíš jako s tím dronem a sedíš na té lodi a nebo prostě ten kapitán takhle jezdí do kolečka a ty furt sedíš na té lodi a teď on jezdí takhle do kolečka a ty volá naš dron, který dělá něco úplně jiného, než cítí ten tvůj senzorický systém toho těla. Tak to je bomba, tam jsou super věci, co si člověk může zažít. Ještě byste pro naše posluchače mohl nastínit takovej úplnej začátek toho, když s tím někdo, s tím lokálním modelováním chce začít. A má třeba už něco doma, třeba nějaký herní počítač nebo si něco chce postavit, tak pár takovejch rad ještě na začátek, jestli bys pro ně měl. Jasně, určitě. Jestli máte doma počítač, který má grafickou kartu v sobě, která má aspoň 16 giga paměti, 24 je ideál, 32 je naprosto super, tak vemte jakýokoliv AI asistenta, který ho máte. A řekněte mu, chci si na svým počítači, který má 24 giga RAM, nebo 16 giga RAM, pustit model pomocí llama.cpp, to je jeden z těch engineů, asi pro tohle to úplně nejlepší, to je takový jednoduchý engine, který se dá stáhnout ve dvou instalačkách, prostě neinstallat, jestli nějaký driver autů. Řekni mi, co mám udělat a napíš mi příkaz na to, jak to spustím. A chtěl bych model QWEN 3.8, 27 miliard parametrů, nebo QWEN 3.6, 35 miliard parametrů, nebo nějaký menší, podle to, když máte té paměti. 16 giga je na tohleto málo, takže tam jsou třeba nějaký 9 nebo 14 miliardový modely. Zase jsou tam různé kveny, jsou tam ty gemy. A řekni mi, kde to mám stáhnout, Hugging Face, vygooglíte si Hugging Face, tam si vygooglíte ten model, napište tam kven, napište tam gema a budete mít. A nebo prostě řekněte tomu kloadovi nebo někomu, ať vám dá link na to stažení. Já si myslím, že tak do 3 čtvrtě hodiny máte doma rozjetý model, který vám bude odpovídat nějakým endpointu, na který budete moct nasměrovat nějakýho agenta, třeba Claude Code nebo něco takového úplně jednoduše. Zase se zeptejte toho svůho agenta, jak to máte udělat. Ten by to udělal za vás. A za hodinu máte prostě svůj vlastní lokální model, který vám bude schopný kontrolovat počítače, který vám prostě pobíží a budu nám odpovídat a dělat věci. Dokáže to v takovémhle setupu udělat i websearch? Nebo na to potřebaš nějaký speciální věci? To je totiž věc, kterou já jsem třeba na těch mobilních věc, kterých jsem zkoušel v telefonu. Tam jsem vždycky narazil a byla to věc, která mě hrozně chyběla. Teď už jsem se někde dobral toho, jak to udělat a jak to volat i na tom telefonu, ale v takhle základu. Model samotný ne. Ten model prostě je model. llama.cpp, ten engine, o kterém jsem mluvil, tak ten má už i nějaké zabudované tooly, které umožňují spouštět terminál příkazy, číst soubory a dělat podobné věci, jako různé operace. A má MCPP, takže pokud, jako takhle, já to řeším tak, že mám něco, co se jmenuje Search XNG, což je prostě instalace, kterou si může každý pustit do kru nebo nainstalovat prostě na počítač a to je jako lokální vyhledávací model, který má v sobě třeba 30 vyhledávačů, 30 Search Engineů a já si vyberu z toho, který chci, aby ten model používal. Většina z nich má nějaké množství dotazů zadarmo a ten model potom může prostě si nechat takový táhnout ty odpovědi. Když už použiješ agenta, jako třeba Hermes Edge, to je druhá věc, kterou bych mě strašně moc doporučit. Prostě zeptejte se svýho modulu, co to je Hermes Agent a jak je ho neinstalovat na Windows nebo na Linuxu, to je jedno, na Windows to běží krásně. To je něco jako Claude Code, nebo jako codex, nebo jako open code, ale má to i webový rozhraní, má to i desktopovou aplikaci, prostě má to i klasický TUI, v tom terminálu se to dá ovládat. A tam už jsou různé nástroje. Třeba je tam headless browser, browser, který nemá UI a který funguje normálně, že si pustí Google a hledá. A to, co tam nejde, tak vytáhne. Nebo pustí Carole, což je takový způsob, jak se ptat nějakýho, to prostě stáhnou data a stáhne ty data a zprocesuje. Takže dá se to udělat a tam trošička konfigurace, nemoc. Ten Hermes Agent to zvádne sám, udělal tady tohle všechno, ale ty ostatní už musíš malinko nakonfigurovat. To je taková věc, která mě tam hrozně scházela, že vlastně už nejsem zvyklý úplně bavit se jenom s tím jazykovým modelem jako takovým, ale že už prostě potřebuju tomu zadávat nějaký úkoly na webu, ať už, jak říkáš, aby to někde otevřelo stránku, někam kliklo, něco mě tam našlo, nebo hledalo prostě přes websearch, prostě nějaký podklady, který mě to zase zpracuje do nějakých researchů. Já mám takhle jako nainstalovaný spoustu věcí, nějaké perplexity, tak já mám třeba variantu perplexity doma, která dokáže dělat jako výzkum, běžeme to doma v Dockeru, ten Search XNG, takže já tam prostě zadám nějakou věc a no to udělá doslova ten výzkum, porovádá to všechny ty zdroje, kam se dostane, kde to není robotama zablokovaný, tak stáhne prostě data a dá mi to a udělá mi nějaké summary, já se můžu doptávat a tak. Je spousta možností, jak to udělat, ale už to vyžaduje jako trošku nějaké konfigurace a práce a zase všechno to zvládnu, udělat ty modely. Řekneš tomu modelu, prostě já bych chtěl tady tohleto, tak on řekne, jo, jasně moment, stáhnu do krahu, stáhne do krahu, udělá to Co nějaká alternativa k Notebook LM od Google? To je taková ovlivná aplikace. Existuje, ale Notebook LM samozřejmě od Google je nejlepší, protože zase ty konektory na všechny ty modely, které ti zatím udělají, prostě ty videa, ty prezentace a tady tyhle, které jsou těžce specializované. Já si teďka nemyslel úplně, to je jich studio, který ti z toho dělá ty pokročilé věci, ale spíš nějaký systém, kde by si člověk udělal ten research. A ten model potom byl trošku víc zakotvený v těch datech, který si dohledá a odpovídá ti na základě nich, ať prostě se uživatelé vyhnou halucinacím, který asi u těchto lokálních modelů budou trošičku ty modely na to náchylnější než ty velký klaudový, kde mezi tím klaudovým modelem a uživatelem stojí zase nějaká aplikace, která trošičku se snaží, aby ty halucinace odstranila. - Obsidian je... - Ten samozřejmě mám. - Obsidian se můžeš nainstalovat i doma, vyloženým obsidianovej server obsidianovou apku a potom říct svýmu modelu, podívej se na Carpatyho LLM Wiki. Carpaty je jedna prostě s osobností, která teď definuje spoustu věcí v tom AI a vymýšlí spoustu použití pro různé věci. Tak on myslel, že tady je to LLM Wiki, kdy prostě řekl, pojďme v Obsidianu udělat nějaké tři složky, do jedné narvete hrubý data, cokoliv, prostě si od někud vyfotíte, stáhnete a takhle pdfka, obrázky, dáte to tam a do těch dalších dvou složek ten model prostě udělá výtah, výcuc, strukturovaný text, všechno, co chceš a co ho poprosíš a potom vytváří postupně, tak mu dáváš ty věci, tak vytváří, dohledává, když chceš, další a další témata. Ještě ty věci, které už máš oloženy, jako poznámky mezi sebou, propojuje, takže on dokáže udělat linky mezi tě to se známe s tím. A ještě je tam taková grafová nástavba, která to dokáže krásně vizualizovat. Takový trojnozněrnej prostě obrázek, kde je propojený ty jednotlivý témata. Jo, to já mám polojený. No, no, no. A to je jako docela bomba, protože to fakt jako funguje úplně perfektně, kdy ty po tomto modelu třeba řekneš, ale najdi tam něco, dobtej se, tady máš toto, jo, najdi na netu a porovnej to s tím a s tím. A ten model to udělá opravdu a ho víc jako ukotvíš v těch datech. A on s tím pracuje, jako s nějakou vektorovou databází, nebo jede jenom v markdownech? Tohle jsou markdowny, myslím. Tohle není vektorová databáze. Já si totiž myslím, že Obsidian je celý jako markdownový. Je to tak, no. Že vlastně tak byl postavený ještě před příchodem L modelů a teďka nabil strašně jako na oblibě a užitečnosti, protože s těma markdownama hlavně klo to jako perfektně pracuje. Je to tak, no. Všechny ty modely to s nima umí jako super a tohleto se prostě nabízí. Zase je to jednoduché stáhnout, jednoduché reinstalovat. Ještě nějaké doporučení, co by začínající uživatel neměl minout? Já myslím, že už to stačí, že už jsme dneska nejdem na fouklý hlavu dost. Já bych o tom mohl mluvit strašně dlouho a... Šetři si něco na příště. No, asi jo. Jo, budu si šetřit na příště. Já určitě něco z toho musím vyzkoušet, i když tady můj pomalu stárnoucí MacBook Pro už se svýma 16 GB paměti toho moc nezvládne, ale ono je to otázka. Já si myslím, že to je stroj, který před rokem bych řekl nezvládne nic a dneska s tou kvantizací a s novýma modelama si myslím, že naopak toho zvládne mnohem víc a víc a víc. Naprosto boží velikost jako na provozování těch malých vision modelů nebo modelů na zpracování textu, takový ty OCR a tak to je to jako úplně super. No rozhodně musím vyzkoušet to třídějní fotek. Aha, to jako zkus, to myslím, že mi překvapilo samotné hodně. To určitě vyzkouším, protože třeba mi to nějaký čas ušetří a třeba toho to donutím i, já bych totiž potřeboval, co bych potřeboval, potřeboval, aby když přijdu sfocení, aby on poznal, které věci jsou focené do různých verzí HDR, protože to fotím do tří fotek, do pětí fotek, fotím to, takže mám ještě skládaný HDR do panoramy, některé věci jsou třeba z 15 fotek, aby se v tom jako zorientoval, vyznal a v Lightroomu, ale teď jsem jistý, jestli je MCPčko do Lightroomu. To asi nemá. Ale minimálně by mi to mohlo nějako předpřídit a ten Lightroom by to potom, protože Lightroom na to má nějakou utilitu, která jako za boha mně jako nefunguje správně. Tak. To máš úkol do příště. Dobře, dobře. Já se zamyslím, já se zamyslím. Já se mě bavilo to, že jsi říkal, že používáš Cloud as Premiere a že ti Cloud jako něco stříhá a připravoje věci, tak já bych zase chtěl tohle to hrozně vyzkoušet s tím svým lokálním dipsykem, anebo s tím druhým modelem prostě. Ten MCP server v Premiere funguje jako skvěle a když tam nedojde k nějakému pomatení smyslu, jako nepoplete se tam něco v těch skillech, který je to vám nastavený, tak teďka už jako to funguje reálně tak, že já zesynchronizuju stopy tady z našeho podcastu, až odejdeš, hodím to Cloudovi, řeknu mu, ať na to pustí to, co dělá s podcastem vždycky a výsledkem toho bude jako se stříhaný díl, bude z toho nachystaných jako 15 shortů s titulkama, s nějakou úvodní koncovou grafikou, bude tam nachystaný nějaký publikační plán na sociální sítě, který on nahraje do upload postu a prostě já si myslím, že za dvě hodiny nebude co řešit a bude takhle jako hezky připraveno. Super, to je naprosto perfektní použití a teď si představ, že to ještě zkombinuješ jako s tím, že ti to býží lokálně ten model a nemusí se to platit. Jo, to by bylo krásný, protože ten Cloud není úplně levnej. Je to tak, ne? Ale zase na druhou stranu, tady jak to to MCP do premiéry jede přes nějaký skryptování, tak tamto tech tokenů to řekne se žere, to by bylo příjemné překvapení, že si myslím, že i lidi, co jedou třeba na 20 dolarovým předplatním, tak to můžou vyzkoušet a můžou na tom spoustu práce udělat maximálně. Zastaví to pětihodinový okno, takže to dodělají prostě v dalším. Ale že na to je to, jako není to žádný žerout tokenů. Já jsem si říkal, protože tam probíhají samozřejmě nějaký analýzy i jako obrazový, ale to dneska jako nic moc nesežere. No, já jsem dokonce na návno viděl takový hack, kdy někdo přišel na to, že když místo, aby poslal text tomu modelu, když udělá fotku, když udělá screenshot a pošel tu fotku, tak to stojí třeba desetkrát míň jako na tokeny, než když je... Do konce. Já vím, proč to screenshotuju. Takže to máš pravdu, tak může být. Hele, každopádně moc děkuji za rozhovor. Rád se s tobou potkám tady nad nějakýma dalšíma novinkama, až výjde zase nějaký nový Kimi nebo... Super model nebo super hardware. No, přesně tak. Tomu hardwareu bychom se mohli tak ještě pověnovat až zase zdražíme. Takže kabely a ramky. Teď jsem viděl nějaký hezký mím na Facebooku Babišovi drahoty, kolik stojí ramka za Babiše a kolik za Fialy. Přesně tak. Je to hrozný, co ten Babiš dělá. A na celém světě. Víš, co mu to přihraje jako dalšímu kandidátovi ve volbách hlasů, až slíbí, že ramka bude... A ramka bude za původník 200 dolarů 32 giga. Takže díky. A já ještě připomenu divákům, že na našem webu, kde skončí zítřek, CZ mají různé slevy na AI akce a konference. Takže mrkněte na to. Minimálně na ČERNÁ.AI Festival. Tam máte 20% slevu a ten festival se blíží. Už tam jsou poslední lístky k dispozici. Takže díky moc. Těším se příště a se všima se očím. Paráda. Díky za super povídání, Martina, za pozvání. Mějte se krásně.

podcast o umělé inteligenciAI novinky českygenerativní AI českytechnologické novinky českytech podcast českybudoucnost technologiíautomatizace s AIKde skončí zítřekDeepSeekQwenlokální AI modelykvantizace modelůllama.cpp
Poslouchat na Substack ↗ Všechny epizody