PR

キャプションを自動生成しよう!LoRA学習におすすめのツールと使い方を解説

ComfyUI
ユキ
ユキ

LoRA作ってみたいんだよね、キャプションっていうのが必要みたいなんだけど?

管理人
管理人

キャプションっていうのはAIに学習させるときにこの画像はこのワードと紐づいてますよって教えるために用意するものだよ。普段使ってるプロンプトみたいなものだね

ユキ
ユキ

それじゃあたくさんプロンプトを書かなきゃいけないの?

管理人
管理人

でも大丈夫、今は自動でキャプションを作ってくれるツールがあるからこれを活用していこう!

LoRA学習では、画像だけでなくキャプション(タグ)も重要な学習データになります。

しかし、画像1枚ごとにキャプションを手作業で作成するのは時間がかかり、画像枚数が多いほど負担も大きくなります。

そこで活躍するのが、画像を解析してキャプションを自動生成できるAIツールです。

この記事では、キャプション自動生成の仕組みやおすすめツール、基本的な使い方を分かりやすく解説します。

キャプション自動生成とは?

キャプション自動生成とは、AIが画像の内容を解析し、学習用のキャプションやタグを自動で作成する機能です。

人物の髪型や服装、表情、背景などを認識し、LoRA学習に利用できるテキストを短時間で生成できます。

数十枚から数百枚の画像でも一括で処理できるため、手作業で入力するよりも大幅に作業時間を短縮できます。

キャプション自動生成のメリット

  • 大量の画像をまとめて処理できる
  • 手入力よりも作業時間を短縮できる
  • キャプション作成の手間を減らせる
  • LoRA学習用データを効率よく準備できる

キャプション自動生成におすすめのツール

現在はさまざまなキャプション生成ツールがありますが、LoRA学習では次のようなツールがよく利用されています。

ツール特徴
JoyCaption人物やシーンを自然な文章で説明できる
WD14 TaggerDanbooruタグ形式で出力。アニメイラストとの相性が良い
Qwen2.5-VL人物や背景の認識精度が高く、細かな特徴も取得しやすい
Florence-2幅広い画像認識に対応し、詳細なキャプションを生成できる

それぞれ特徴が異なるため、学習したい内容に合わせて使い分けるのがおすすめです。


今回使用するツール

今回はWD14 Taggerを使用して、LoRA学習用のキャプションを自動生成する方法を解説します。WD14 Taggerは、アニメ・イラスト画像向けのタグ生成に特化しており、Danbooru形式のタグを高精度に出力できるため、多くのLoRA学習で利用されています。

WD14 Taggerでキャプションを自動生成する方法

ノードのインストール

まず「WD14 Tagger」のノードを追加します。ComfyUIを開いて「拡張機能の管理」から「ComfyUI-WD14-Tagger」を検索してノードをインストールしてください。

続いて「JoyCaption」のノードを追加します。同様の検索画面に「ComfyUI-JoyCaption」と検索しインストールしてください。

ワークフローの作成

次に以下の4つのノードを呼び出して下さい。

  • Image Batch Path
  • Caption Saver
  • WD14 Tagger
  • 連結

接続は画像を参考にお願いします。

各ノードの設定、役割

Image Batch Path

これはキャプションをつけたい画像を読み込むノードです。

中央の空欄には画像のフォルダのパスを入力してください。

batch sizeは画像の枚数指定なので用意した画像分の数字を入れてください。

WD14 Tagger

これはタグ付けのノードで、どの程度タグをつけるのかなどの設定があります。

触らなくても大丈夫なので初期値、または画像を参考に設定してください。

Caption Saver

キャプションを保存するノードです。空欄に保存先のフォルダのパスを入力してください。

画像と同じフォルダを指定してもいいですし、後で編集するので専用のフォルダを用意してもよいです。

連結

これは、自動取得したキャプションにワードを追加できるノードです。

上が先頭、下が末尾に追加します。上の空欄に自分で設定する「トリガーワード,」を入力しておけばよいでしょう。

テスト生成

以上の設定が完了したら「実行する」ボタンを押し、キャプションが生成されるか確認してください。

また、生成されたらいくつかのキャプションを確認し、十分なタグ付けがされていれば次へ、不十分、余分なタグ付けであれば設定を変更し再生成してください。

キャプションの編集

キャプションの編集は様々な方法がありますが、ここではNotepad++をつかった例を紹介します。

Notepad++は複数のテキストファイルを開くことができ、一括検索、一括編集ができるので使用しています。

すべてのファイルを開いたら「Ctrl+H」で置換を出します。キャプションの編集は基本的にワードを削除していきます。

検索文字列に「削除したいワード,」を入力し、置換文字は空欄のまま「すべての文書で置換」で完了です。

編集が終わりましたら「Ctrl+Shift+S」のすべて保存して完了です。

タグを検索するコマンド

編集に便利なコマンドがあるのでここで紹介します。

キャプションのテキストファイルがあるフォルダを開きます。

空いているところを右クリックし「ターミナルで開く」でpowershellを起動します。

以下のコマンドを入力します

Get-ChildItem *.txt | ForEach-Object { Get-Content $_ } | ForEach-Object { $_ -split "," } | ForEach-Object { $_.Trim() } | Where-Object { $_ -ne "" } | Group-Object | Sort-Object Count -Descending | Select-Object Count,Name | Out-File tag_count.txt -Encoding utf8

これでフォルダにあるテキストファイルにどんなタグが何個あるのかという表を作ってくれます。

編集にご活用ください。

キャプションの編集について|どのタグを残せばいいのか

1. 削除すべきタグ(LoRAに学習させたい要素)

LoRAの学習では、「キャプションに書かれていない要素」が画像から抽出されてLoRAに蓄積されます。そのため、LoRAに固定で覚えさせたい特徴のタグはキャプションから削除します。

  • 特定のキャラクターやキャラクターの特徴:
    • 特定の髪型、髪色、目の色、固定の衣装など(例: blue eyes, twintails, sailor uniform )。
    • これらをキャプションに残してしまうと、AIは「これはベースモデルが元から知っている blue eyes だな」と判断し、LoRAの中にその特徴が書き込まれにくくなります。
  • 特定の画風や絵柄(スタイルLoRAの場合):
    • 独特な線画、塗り方、質感など。これらを表現するタグ(例: watercolor style, thick coating)を細かく残すと、LoRAとしての画風の固定力が弱まります。

2. 残すべきタグ(LoRAに学習させたくない要素)

キャプションにタグを残すと、AIは「この要素はLoRAではなく、このタグの力で描画している」と認識します。結果として、LoRAのデータからその要素が排除(クレンジング)され、衣装替えやポーズ変更が自由にできる柔軟なLoRAになります。

まとめ

ユキ
ユキ

キャプションって手作業なのかと思ったけど、自動生成できるならすごく便利だね!

管理人
管理人

そうだね。自動生成ツールを使えば、大量の画像でも短時間でキャプションを作成できるよ。ただし、自動生成されたタグをそのまま使うのではなく、不要なタグを整理することも大切なんだ。

ユキ
ユキ

まずは自動生成して、必要なところだけ調整するのがポイントなんだね!


WD14 Taggerを使えば、LoRA学習用のキャプションを効率よく自動生成できます。

大量の画像でも一括でタグを作成できるため、手作業に比べて大幅に作業時間を短縮できるのが魅力です。

ただし、より精度の高いLoRAを作成するには、自動生成されたキャプションを確認し、不要なタグを整理することが重要です。

ぜひWD14 Taggerを活用して、効率よくLoRA学習用のデータセットを作成してみてください。

コメント

タイトルとURLをコピーしました