🗓️ 公開日: 2026年9月19日 🔄 最終更新日: 2026年9月19日
今回はComfyUIで【IrodoriTTS】を使ったキャラボイスの作り方と完全固定する方法についての記事です。
IrodoriTTSでキャラボイスを作成することにより、MinimaxH3でAIアニメを制作する際にキャラクターの声を完全に固定化できます。
その他にも、動画のナレーション、VTuberのボイス、ACE-StepでのAI歌唱など幅広い用途で活用可能です。
完全無料かつローカル環境で動くため、生成制限を気にすることなく無制限に試行錯誤できます。
IrodoriTTSのノードの準備とモデルのダウンロード
IrodoriTTSはAratako様が開発された高品質な日本語音声合成AIです。
本来はスタンドアロンのWebUIアプリであるため、モデルをダウンロードしてもそのままではComfyUIで使用できません。
ComfyUI上で動作させるには、有志の方が開発したカスタムノード「ComfyUI-Irodori-TTS」を導入する必要があります。
ノードのリポジトリ&インストール
jupo-ai様が開発されたcomfy-Irodori-TTSを、以下のリポジトリからComfyUIのcustom_nodesディレクトリ内にクローン(またはダウンロードして配置)してください。
IrodoriTTSモデルのダウンロード
現在、本家IrodoriTTSのモデルはバージョンV4.1まで公開されていますが、ComfyUIノード側で対応しているのはV2となります。
アニメ風のキャラクターボイスを作成する場合、ComfyUI環境ではV2モデルを使用します。V2でもクオリティは非常に高く実用に十分耐えうる性能です。
V2モデルには通常版と「VoiceDesign版」が存在しますが、VoiceDesign版のダウンロードを強くおすすめします。
VoiceDesign版を選ぶことで、専用ノード(VoiceDesign Config)を使ってプロンプトから声質を細かくコントロールできるようになります。
モデルをダウンロードされたら以下のディレクトリにモデルを保存してください。
📁ComfyUI
└ ─📁models
└ ─📁chackpoints
└ ─model.safetensors(IrodoriTTS-V2モデル)
ComfyUI-Irodori-TTSの使い方
ここからは、ComfyUI-Irodori-TTSを使った基本的な音声作成の流れを解説します。
まずはワークフロー内に以下の必須ノードを配置します。
- IrodoriTTS Model Loader
- IrodoriTTS Sampler
- IrodoriTTS VoiceDesign Config
- オーディオを保存(詳細)
IrodoriTTS Model Loaderの設定

model:読み込むIrodoriTTSのモデルファイル(.safetensors)を選択します。
model_device:モデルを実行するデバイスを選択します。NVIDIAのGPUを使用している場合は「cuda」、CPUを使用する場合は「cpu」を選択します。GPUを使用する方が高速に生成できます。
model_precision:モデルの計算精度を選択します。デフォルトは「fp32」です。「fp16」を選択すると、計算速度は速くなりますが、生成される音声の品質が少し低下する可能性があります。
codec_device:音声データをデコードするデバイスを選択します。デフォルトは「cuda」です。GPUを使用する方が高速に処理できます。
codec_precision:音声データのデコードの計算精度を選択します。デフォルトは「fp32」です。「fp16」を選択すると、デコード速度は速くなりますが、生成される音声の品質が少し低下する可能性があります。
enable_watermark:生成された音声にウォーターマーク(電子透かし)を入れるかどうかを選択します。デフォルトは「false」です。ウォーターマークを入れると、生成された音声がIrodoriTTSで生成されたものであることがわかります。
compile_model:モデルをコンパイルするかどうかを選択します。デフォルトは「false」です。コンパイルすると、生成速度が向上する場合がありますが、コンパイルに時間がかかることがあります。
compile_dynamic:動的な形状をサポートするようにコンパイルするかどうかを選択します。デフォルトは「false」です。「compile_model」が「true」の場合に有効です。入力されたテキストの長さに合わせてコンパイルが調整されますが、コンパイルに時間がかかることがあります。
runtime_cache_policy:実行時のキャッシュポリシーを選択します。
offload_after_use:生成が終わると、モデルをGPUのVRAMから メインメモリであるRAMへ退避(オフロード) させます。
keep_gpu:生成が終わっても、モデルをそのまま GPU(VRAM)上に保持 し続けます。VRAM使用率は上がるがモデルの読み込みをスキップ出来るので高速で生成できる。
unload_after_use:生成が終わると、モデルをVRAMからもRAMからも完全にアンロードします。VRAMとRAMの搭載容量が少ない場合のみ選択。
IrodoriTTS Samplerの設定

seed / 生成後の制御:seedを固定する場合はseedを入力し、生成後の制御をfixedにしてください。
seconds:生成する音声秒数の目安を入力します。0にすると稀に数十秒もの長さの音声が生成される場合があるので、ある程度の目安を入力してください。
num_steps:音声をサンプリングする際のstep数を選択してください。値を大きくすればクオリティは上がりますが、生成速度は落ちます。低くすれば生成速度は早くなりますが、クオリティが落ちます。40前後が推奨値です。
batch_size:一度にまとめて何個の音声を作るかを選択します。
decode_mode:音声データを作成する際の計算モードです。デフォルトのsequentialのままで問題ありません。
context_kv_cache:計算効率を上げるための機能です。デフォルトのtrueのままで問題ありません。
max_text_len:入力するテキストの最大文字数を制限します。「0」は制限なしで0のままで問題ありませんです。
trim_tail:生成された音声の最後にある「余白(無音区間)」を自動的にカットするかを選択します。基本的にはtrue推奨です。
IrodoriTTS VoiceDesign Config

こちらのノードにはセリフを書かずに、声の特徴や声質を日本語で入力してください。
max_caption_lenは声の特徴(キャプション)をAIが読み取るときに受け付けるトークン数の最大リミット数です。
値を大きくしすぎるとVRAMをわずかに圧迫します。256あれば問題ないかと思います。
オーディオを保存(詳細)

生成された音声ファイルを指定フォーマットで書き出します。
選択肢としてFLAC、MP3、OPUS等がありますが、FLACでの保存がおすすめです。
FLACはWAVと同様に完全な可逆圧縮(ロスレス)でありながら、音質を一切落とさずにファイルサイズを約半分に抑えられます。MinimaxH3などの外部ツールとも高い親和性を持っています。
ComfyUI-Irodori-TTSの接続例

最小構成では上記の通り接続すれば音声生成が可能です。
拡張ノードIrodoriTTS Reference Audio(音声固定したい場合)

キャラクターの声を作品全体で統一したい場合は、お手本となる音声を参照させる「リファレンス機能」を活用します。 VoiceDesignなどで生成して「これだ!」と思える理想の声が出たら、その音声ファイルをIrodoriTTS Reference Audioノードに読み込ませ、出力ピンをIrodoriTTS Samplerのref_configに接続します。
audio:リファレンスとして使用する音声ファイルを選択します。
normalize_ref_audio:読み込んだ音声の音量を「ノーマライズ(均一化・適正化)」するかどうかの設定です。faleseで原音の音量のままリファレンスさせます。trueで一定の基準レベルまで音量を自動で引き上げ・調整します。音量が小さすぎる場合のみtrueで問題ありません。
max_ref_seconds:読み込んだ音声の「最大秒数」の上限を指定します。12秒の音声の中で10秒までリファレンスしたい場合は10と入力します。
拡張ノードIrodoriTTS Emoji Picker

拡張ノードとは違いますが、IrodoriTTSは、セリフのテキストの中に特定の「絵文字」を埋め込むことで、声のトーンや演技のニュアンス、吐息などの効果音をコントロールできる というユニークな機能を持っています。
絵文字をクリックする事でコピーされるので、セリフ欄にペーストして使います。
キャラクターの感情の抑揚を簡単に付ける事が出来るので、是非活用してみてください。
サンプル音声
ComfyUI-Irodori-TTSで作成したサンプル音声を公開します。
- 焦っている少女
- オリジナルキャラクター「ジル」の声
音声リファレンスで生成した7つのファイルを繋げています。
- オリジナルキャラクター「フラン」の声
こちらは1発生成です。
さいごに
今回はComfyUI-Irodori-TTSを活用したキャラクターボイスの生成と、声質の固定化テクニックについて解説しました。
このワークフローを組んでおけば、MinimaxH3でのアニメーション制作時にもブレないキャラクターボイスを一貫して供給できるようになります。音声リファレンスを使用する際は、ノイズの少ない10秒前後の音声をリファレンス元として指定することが声質をしっかり安定させる最大の秘訣です。
ぜひオリジナルのキャラクターボイスを作成し、ご自身のアニメーションや創作制作に命を吹き込んでみてください!
よければこちらの記事もご覧ください




