スタジオのつまみ全部と、実際に結果を変えるのはどれか
著者: Fellowiチーム · · 6 分で読めます

どのジェネレーターにも操作の列がありますが、その操作が実際に何をするのかはほとんど説明されません。だから人には癖がつきます。いつもHigh quality、いつもPNG、いつも4K、いつも選べるなかで最大の数字。これはすぐに高くつき、驚くほど効きません。
ここに全体を並べます。各操作が本当に変えるもの、そして最後に正直な順位を。先に一つ断っておきます。この業界ではこの語が雑に使われるので。ここにモデルのファインチューニングはありません。LoRAも、あなたの画像での学習も、カスタムチェックポイントもありません。あるのは生成ごとの操作で、それは別の、もっと直接的なものです。
画像: 操作は三つ
画質。Standardは1.5Kで40コイン、Highは2Kで60コイン。差が出るのは細かな質感、主に肌と布で、構図にはまったく出ません。構図の悪い2Kの絵は、大きい構図の悪い絵です。探索はStandard、仕上げはHigh。同じ理屈の詳細は StandardかHighか、PNGかJPEGかにあります。
形式。PNGは可逆で大きく、JPEGは圧縮で小さい。編集ソフトで本格的に触るならPNG。眺める、送る、動画の開始フレームに使うなら、JPEGは見た目が同じでサイズはごく一部です。
アスペクト比。自動を含めて十六通り。これは前の二つより絵への影響が大きい操作です。モデルは与えられた形に合わせて構図をつくるからです。16:9でポートレートを頼めば風景に取り残された人物が返り、4:5で頼めばポートレートが返ります。こだわりがないなら、自動がモデルに妥当な選択をさせます。
動画: 操作は六つ
モデル。圧倒的に最大の梃子であり、ほとんどの人が一度も触らないものでもあります。四つあります。画像からとテキストから、それぞれに速いturboと、遅くて鋭いフル。テキストからは一文から場面ごと発明し、画像からはあなたがすでに承認した静止画を動かします。特定の人物なら画像の側がほぼ常に勝ちます。顔の問題がもう片づいているからです。
解像度。秒単位の課金で、幅は非常に大きいです。turboは720pで毎秒125コイン、1080pで150。フルは480pで115、720pで225、1080pで550、4Kで1100。4Kは、すでに手応えのあるカットへの仕上げの一手と考えてください。
長さ。4秒から30秒まで、秒単位の課金。長いほうが安全ということはありません。モデルには崩れる時間が余分に与えられるので、長いクリップは大きな賭けであって、良い賭けではありません。
アスペクト比。自動を含めて七通り。動画での自動は「開始画像の構図を保つ」という意味で、選んだ比率よりこちらが正解である場面のほうがずっと多いです。
音。オンかオフ、どちらも無料。あとで自分の音を足すつもりなら、オフが正解です。
開始フレームと終了フレーム。ほとんど誰も使っていないものです。最初と最後の画像を両方渡せば、モデルは動きの着地点を即興でつくるのではなく、そのあいだの動きを組み立てます。動きを「書く」のと「演出する」の差です。詳しくは Fellowi Videoが実際にできることの記事に。
設定ではない操作
一貫性については、参照画像がすべてのつまみを合わせたより効きます。文章で顔は運べません。同じ説明からの二回の生成は、形容詞をいくら足しても別人を返します。代わりに一枚渡せば、似姿が保たれます。コンパニオンの写真が五十枚目でも彼女に見えるのはそのためで、あなたは動画の開始フレームを通して直接それを使えます。手順は キャラクターの見た目を揃える方法に。
正直な順位
- プロンプト。ほかは並びません。場所、光源、ポーズのある具体的な場面は、どんな設定変更にも勝ちます。まずは 効くプロンプトの書き方、露骨な版は きちんと描かれるNSFWプロンプトの書き方から。
- 参照画像。誰が写るかを気にするなら。
- アスペクト比。大きさだけでなく構図を変えるので。
- モデル。動画で。turboとフルは、実際の価格差に見合う実際の品質差です。
- それ以外、つまり画質、形式、長さ、音。これらは何をいくらで手に入れるかを決めます。良いかどうかは決めません。
そしてこれ全部を手の届くものにしているのは設定ですらありません。失敗した生成は全額自動で返金されます。だから操作の正しい使い方は、まず安い組み合わせで試し、カットが効くと分かってから高いほうに払うことです。スタジオを開いて、つまみは一度にひとつずつ動かしてください。