Fellowi

Proč vás generátory obrázků odmítají a co se tam doopravdy děje

Autor: Tým Fellowi · · 8 min čtení

Tři průsvitné fialové brány rozestavené na tmavém poli, každá užší než předchozí, a nikdo, kdo by jimi procházel.

Existuje zvláštní druh frustrace, který se objevuje jen u generátorů obrázků. Něco napíšete, vrátí se prázdno nebo hláška tak nijaká, že může znamenat cokoli, a vy netušíte, jestli jste žádali něco zakázaného, špatně to zformulovali, nebo narazili na chybu. Tak náhodně změníte slovo a zkusíte to znovu. Občas to projde, což je nejhorší možný výsledek, protože jste se právě naučili pověru místo faktu.

Užitečné je pochopit, že „generátor mě odmítl“ popisuje nejméně tři úplně odlišné systémy, postavené jinými lidmi z jiných důvodů a selhávající jinak. Jakmile je umíte rozlišit, většina záhady zmizí a slušná část odmítnutí se ukáže jako opravitelná.

Vrstva první: seznam zakázaných slov

Nejlevnější filtr běží dřív, než se cokoli vygeneruje. Přečte váš text, porovná ho se seznamem slov a vzorů a při shodě rovnou odmítne. Tahle vrstva dává okamžitá odmítnutí, obvykle do vteřiny po kliknutí, a zároveň se kolem ní nejčastěji úspěšně obchází změnou slovníku.

Je také nejhrubší. Seznamy nečtou kontext, takže chytají obrovské množství naprosto nevinné práce: anatomické termíny v lékařské ilustraci, běžná slova, která jsou někde slangem, jména postav kolidující s něčím nesouvisejícím. Kdo někdy zkoušel vygenerovat řeznictví nebo hodinu kresby podle živého modelu, s touhle vrstvou se potkal.

Poznáte ji podle rychlosti a stálosti. Když je zadání odmítnuto okamžitě a pokaždé přesně stejně, skoro jistě visíte na textovém filtru, ne na něčem, co souvisí s obrázkem.

Vrstva druhá: samotný model

Druhá vrstva vůbec není filtr, a proto se chová tak podivně. Dnešní obrazové modely se trénují s preferencí pro některé výstupy a proti jiným, takže požadavek, od kterého byl model odveden, se neodmítá, ale tiše zhorší. Žádali jste jedno a dostali sousední: bledší, oblečenější, neurčitější. Nic se neohlásilo. Jen obrázek vyšel hůř a vy neumíte říct proč.

Právě tahle vrstva vede lidi k domněnce, že jsou špatní v psaní promptů. V jistém smyslu se nemýlí, ale problém není jejich slovník. Model s nimi vyjednává a má poslední slovo.

Taky se nejhůř odstraňuje. Seznam slov poskytovatel smaže za jedno odpoledne. Vrátit trénink je jiný řád problému, a proto i opravdu shovívavé nástroje občas vzdorují a proto se vyplatí číst slovo „necenzurovaný“ pozorně. Co může znamenat poctivě, je v textu o tom, co ve skutečnosti znamená necenzurovaný generátor.

Vrstva třetí: klasifikátor, který se dívá na výsledek

Třetí vrstva běží, až obrázek existuje. Samostatný model se podívá na hotový snímek, oboduje ho a zablokuje doručení, pokud skóre překročí čáru. Zaplatili jste za vykreslení, vykreslení proběhlo, a pak něco jiného rozhodlo, že ho nedostanete.

Tahle vrstva vysvětluje to nejvíc k zešílení dohánějící chování v celé kategorii: stejné zadání projde v úterý a spadne ve čtvrtek. Generování je náhodné. Pusťte zadání dvakrát a dostanete dva různé obrázky. Leží-li váš požadavek někde u prahu klasifikátoru, jeden ho překročí a druhý ne. Vy jste nic neudělali jinak. Padly jiné kostky.

Pokud jste někdy byli přesvědčení, že služba v noci potichu utáhla filtry, obvykle se dělo tohle. Někdy poskytovatelé opravdu utahují. Mnohem častěji jste byli celou dobu na hraně a všimli jste si toho v den, kdy jste dvakrát po sobě spadli na špatnou stranu.

Proč vám nikdo neřekne, která vrstva vás chytila

Protože konkrétní chybová hláška je návod, jak filtr obejít. Řekněte někomu „slovo X bylo zablokováno“ a naučili jste ho přesně, co vyměnit. Skoro každý poskytovatel proto vrací jedno mlhavé odmítnutí na všechny tři příčiny, a výsledkem je, že poctivý uživatel s neškodným zadáním dostane stejnou neprůhlednou hlášku jako ten, kdo hledá díry.

Je to obhajitelný kompromis a na přijímací straně skutečně nepříjemný. Vysvětluje taky, proč je tolik rad o promptech na internetu folklor: lidé hledají vzorce v neviditelném systému a předávají si rituály, které jednou zabraly.

Jediný návyk, který přežije všechny tři vrstvy

Nikdy nepojmenovávejte to, co na obrázku nechcete. „Bez nahoty“ vloží nahotu do zadání, kde ji první vrstva může zachytit, druhá ji zváží a třetí ji nakonec začne hledat. Obrazové modely nemají spolehlivý pojem negace, takže zápor se čte jako téma.

Přišli jsme na to ve vlastním systému, ne z článku. Raná verze instrukce, kterou vkládáme před každé generování, pojmenovala tělesný rys, aby ho udržela, a v podstatě říkala, že ten člověk je plešatý. Model to přečetl jako něco k nakreslení a začal vydávat plešaté lidi v konverzacích s postavami, které vlasy mají. Opravou bylo přestat uvádět hodnoty vlastností úplně. Celá sada návyků, které z toho plynou, je v textu o NSFW promptech, které se opravdu vykreslí, a verze pro anime v textu o tom, proč se anime styl brání.

Co děláme místo toho

Ve Fellowi se odmítají dvě věci a zůstane to tak: cokoli sexuálního s nezletilými a jakékoli zobrazení bez souhlasu. To je celý seznam, není to knoflík a žádný tarif ho neodemyká. Všechno ostatní mezi dospělými je povolené, a právě proto nás nic nestojí říct hranice takhle prostě.

Pro všechno, co nespadá do těch dvou, platí zásada, že selhání vás nesmí nic stát. Když se zadání nevrátí, zkusíme jednou mírnější verzi vašich vlastních slov, a pokud selže i ta, mince se automaticky vrátí do peněženky. Neplatíte za právo hádat. Právě tohle jedno pravidlo dělá z přepsání rozumnou reakci na odmítnutí, místo aby si člověk šetřil nápady a zkoušel od každého tu nejnudnější verzi.

Jestli jste bojovali s generátorem, který neřekne, co mu vadí, poctivý test je jediný: jděte si říct o to, co jste doopravdy chtěli. Otevřete generátor, nebo si nejdřív přečtěte naši politiku běžným jazykem na stránce generátoru 18+.

Vyzkoušej si to sám

Vřelá, soukromá společnice AI: 7 dní zdarma a 30 zpráv, bez karty.

Ceny a limity

Číst dál