翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
Stability AI Image Services
Amazon Bedrock で Stability AI Image Services を使用すると、13 の特殊な画像編集ツールにアクセスできます。これらのツールは、プロフェッショナルなクリエイティブワークフローを加速するように設計されています。Stability AI Image Services を使用すると、スケッチからイメージを生成し、既存のイメージを再構築して、スタイルを変更することができます。イメージ内のオブジェクトを削除および置き換えることもできます。
このセクションでは、InvokeModel を使用して Stability AI Image Services に対する推論呼び出しを行う方法について説明します。このセクションでは、Python のコード例と Stability AI Image Services を使用する前と後の画像の例についても説明します。
Stability AI Image Services は、次のカテゴリで利用できます。
編集 – マスク (生成フィル) や単語によるペイントなど、AI ベースの画像編集サービス。製品配置および広告ツールと、背景の削除などの基本的なツールが含まれます。
コントロール – プロンプト、マップ、その他のガイドを取得する場合があります。これらのサービスは、安定拡散モデル上に構築された ControlNets および同様のテクノロジーを使用します。
注記
Stability AI Image Service をサブスクライブすると、利用可能な 13 個の Stability AI Image Services すべてに自動的に登録されます。
リクエストとレスポンス
リクエスト本文は、InvokeModel へのリクエストの body フィールドに入れて渡されます。
モデル呼び出しリクエストの body フィールド
Stability AI Image Services を使用して InvokeModel 呼び出しを行うときは、本文フィールドに次のような JSON オブジェクトを入力します。
{ 'prompt': 'Create an image of a panda' }
モデル呼び出しレスポンスの body フィールド
Stability AI Image Services を使用して InvokeModel 呼び出しを行うと、レスポンスは次のようになります。
{ 'seeds': [2130420379], 'finish_reasons': [null], 'images': ['...'] }
seeds – (文字列) モデルの画像生成に使用されるシードのリストです。
-
finish_reasons – リクエストがフィルタリングされたかどうかを示す列挙型です。
nullはリクエストが成功したことを示します。現在の可能な値:"Filter reason: prompt", "Filter reason: output image", "Filter reason: input image", "Inference error", null。 -
images – base64 文字列形式で生成された画像のリストです。
詳細については、https://platform.us.stability.ai/docs/api-reference#tag/v1generation
アップスケール
次のセクションでは、アップスケールの Stability AI Image Services について説明します。
Creative Upscale は 64x64~1 メガピクセルのイメージを取得し、4K 解像度にスケールアップします。このサービスは、画質を維持して多くの場合強化しながら、イメージを 20~40 倍アップスケールできます。Creative Upscale は、高パフォーマンスのイメージに最適です。1 メガピクセル以上の写真には適していません。
Creative Upscale には次の必須パラメータがあります。
prompt – 出力イメージに表示する内容。要素、色、件名を明確に定義する強力でわかりやすいプロンプトは、より良い結果につながります。特定の単語の重みを制御するには、形式 (word:weight) を使用します。ここで、word は重みを制御する単語、weight は値です。値 0 と 1.0 では単語の強調が軽減され、値 1.1 と 2 では単語 が強調されました。例えば、(青:0.3) はクリアな青い空を意味しますが、(緑:1.8) は青と緑からなるが青よりも緑が多い空を意味します。最小 0 文字、最大 10,000 文字です。
image – (文字列) スケールアップする Base64 イメージ。画像のすべての辺を 64 ピクセル以上にする必要があります。合計ピクセル数は 4,096~1,048,576 ピクセルである必要があります。サポートされている形式: jpeg、png、webp。
以下のパラメータはオプションです。
創造性 – (数値) イメージをスケールアップするときにモデルがどの程度創造的であるかを示します。値を大きくすると、アップスケーリング中にイメージに詳細が追加されます。範囲は 0.1~0.5 です。デフォルト 0.3
negative_prompt – (文字列) 出力イメージに表示したくない内容を説明するテキストのぼかし。これはアドバンスド機能です。最大 10,000 文字。
seed – (数値) 生成の「ランダム化」のガイドに使用される特定の値。(このパラメータを省略するか、0 を渡してランダムシードを使用します)。範囲は 0~4294967294 です。デフォルトは 0 です。
output_format – (文字列) 生成されたイメージのコンテンツタイプを指定します。列挙型: jpeg、png、webp。デフォルトは png です。
style_preset – イメージモデルを特定のスタイルに向けてガイドします。列挙型: 3d-model、analog-film、anime、cinematic、comic-book、digital-art、enhance、fantasy-art、isometric、line-art、low-poly、modeling-compound、neon-punk、origami、photographic、pixel-art、tile-texture。
次の表は、クリエイティブアップスケールオペレーションの入力イメージと出力イメージを示しています。使用されるプロンプトは次のとおりです。このドリームのようなデジタルアートは、ロンドンの鮮やかで華麗なビッグベンをキャプチャします。
|
Input |
Output |
|---|---|
Willemijn Doelman |
|
Conservative Upscale は 64 x 64 ~ 1 メガピクセルの画像を取得し、4K 解像度にスケールアップします。このサービスは、すべての側面を維持しながら、イメージを 20~40 倍アップスケールできます。Conservative Upscale はイメージへの変更を最小限に抑え、イメージを再考するために使用しないでください。
保守的なアップスケールには、次の必須パラメータがあります。
prompt – 出力イメージに表示する内容。要素、色、件名を明確に定義する強力でわかりやすいプロンプトは、より良い結果につながります。特定の単語の重みを制御するには、形式 (word:weight) を使用します。ここで、word は重みを制御する単語、weight は値です。値 0 と 1.0 では単語の強調が軽減され、値 1.1 と 2 では単語 が強調されました。例えば、(青:0.3) はクリアな青い空を意味しますが、(緑:1.8) は青と緑からなるが青よりも緑が多い空を意味します。最小 0 文字、最大 10,000 文字です。
image – (文字列) スケールアップする Base64 イメージ。画像のすべての辺を 64 ピクセル以上にする必要があります。合計ピクセル数が 9,437,184 ピクセルを超えることはできません。画像のアスペクト比は 1:2.5 と 2.5:1 の間にする必要があります。サポートされている形式: jpeg、png、webp。
以下のパラメータはオプションです。
創造性 – (数値) イメージをスケールアップするときにモデルがどの程度創造的であるかを示します。値を大きくすると、アップスケーリング中にイメージに詳細が追加されます。範囲は 0.1~0.5 です。デフォルト 0.35
negative_prompt – (文字列) 出力イメージに表示したくない内容を説明するテキストのぼかし。これはアドバンスド機能です。最大 10,000 文字。
seed – (数値) 生成の「ランダム化」のガイドに使用される特定の値。(このパラメータを省略するか、0 を渡してランダムシードを使用します)。範囲は 0~4294967294 です。デフォルトは 0 です。
output_format – (文字列) 生成されたイメージのコンテンツタイプを指定します。列挙型: jpeg、png、webp。デフォルトは png です。
次の表は、保守的なアップスケールオペレーションの入力イメージと出力イメージを示しています。使用されるプロンプトは次のとおりです。このドリームのようなデジタルアートは、ロンドンの鮮やかで華麗なビッグベンをキャプチャします。
|
Input |
Output |
|---|---|
Willemijn Doelman |
|
Fast Upscale は、予測 AI と生成 AI を使用して画像の解像度を 4 倍向上させます。この軽量で高速なサービスは、圧縮されたイメージの品質を高め、ソーシャルメディアの投稿やその他のアプリケーションに適しています。
高速アップスケールには、次の必須パラメータがあります。
image – (文字列) スケールアップする Base64 イメージ。幅は 32~1,536 ピクセルである必要があります。高さは 32~1,536 ピクセルである必要があります。合計ピクセル数は 1,024~1,048,576 ピクセルである必要があります。サポートされている形式: jpeg、png、webp。
output_format – (文字列) 生成されたイメージのコンテンツタイプを指定します。列挙型: jpeg、png、webp。デフォルトは png です。
次の表は、高速アップスケールオペレーションの入力イメージと出力イメージを示しています。
|
Input |
Output |
|---|---|
Willemijn Doelman |
|
編集
次のセクションでは、Stability AI Image Services の編集について説明します。
インペイントは、マスク画像の内容に基づいて、指定された領域に新しいコンテンツを入力または置き換えることで、画像をインテリジェントに変更します。
インペイントの必須パラメータは次のとおりです。
prompt – 出力イメージに表示する内容。要素、色、件名を明確に定義する強力でわかりやすいプロンプトは、より良い結果につながります。特定の単語の重みを制御するには、形式 (word:weight) を使用します。ここで、word は重みを制御する単語、weight は値です。値 0 と 1.0 では単語の強調が軽減され、値 1.1 と 2 では単語 が強調されました。例えば、(青:0.3) はクリアな青い空を意味しますが、(緑:1.8) は青と緑からなるが青よりも緑が多い空を意味します。最小 0 文字、最大 10,000 文字です。
image – (文字列) インペイントする Base64 イメージ。画像のすべての辺を 64 ピクセル以上にする必要があります。合計ピクセル数が 9,437,184 ピクセルを超えることはできません。画像のアスペクト比は 1:2.5 と 2.5:1 の間にする必要があります。サポートされている形式: jpeg、png、webp。
以下のパラメータはオプションです。
style_preset – (文字列) 画像モデルを特定のスタイルに導きます。列挙型: 3d-model、analog-film、anime、cinematic、comic-book、digital-art、enhance、fantasy-art、isometric、line-art、low-poly、modeling-compound、neon-punk、origami、photographic、pixel-art、tile-texture。
negative_prompt – (文字列) 出力イメージに表示したくない内容を説明するテキストのぼかし。これはアドバンスド機能です。最大 10,000 文字。
seed – (数値) 生成の「ランダム化」のガイドに使用される特定の値。(このパラメータを省略するか、0 を渡してランダムシードを使用します)。範囲は 0~4294967294 です。デフォルトは 0 です。
output_format – (文字列) 生成されたイメージのコンテンツタイプを指定します。列挙型: jpeg、png、webp。デフォルトは png です。
mask – (文字列) ピクセル単位でインペイントプロセスの強度を制御します。2 番目のイメージ (このパラメータに渡されます) またはイメージパラメータのアルファチャネルを介して制御できます。
マスクを渡す – このパラメータに渡されるイメージは、任意のピクセルで、指定されたピクセルの暗さまたは明るさに基づいてインペイントの強度を表す白黒のイメージである必要があります。完全に黒いピクセルはインペインティング強度を表し、完全に白いピクセルは最大強度を表します。マスクのサイズが画像パラメータと異なる場合、マスクは自動的にサイズ変更されます。
アルファチャネルサポート – 明示的なマスクを指定しない場合、マスクはイメージパラメータのアルファチャネルから取得されます。透明ピクセルはインペイントされ、不透明ピクセルは保持されます。アルファチャネルを含む画像がマスクとともに指定される場合、マスクが優先されます。
grow_mask – マスクのエッジを、指定したピクセル数だけすべての方向に外側に移動します。マスクの周囲の拡張領域がぼやけ、インペイントされたコンテンツと元の画像間の遷移を滑らかにすることができます。範囲は 0~20 です。デフォルトは 5 です。インペイントされたコンテンツの周囲にシームや粗いエッジがある場合は、このパラメータを試してください。過剰に大きくすると、マスク内の細かいディテールが不明瞭になったり、近くのマスクされた領域がつながったりする可能性がある点に注意してください。
次の表は、インペイントオペレーションの入力画像と出力画像を示しています。
|
Input |
マスク |
Output |
|---|---|---|
Stable Image Ultra によって生成された「大都市の人間」、Sanwal Yousaf によるプロンプトと編集。CC BY 4.0 |
|
|
Outpaint は、任意の方向にスペースを埋めるために、イメージに追加のコンテンツを挿入します。画像コンテンツを拡張する他の自動または手動の方法は、目に見えるアーティファクトを残す可能性があります。Outpaint サービスは、元のイメージが編集されたことを示す表示を最小限に抑えます。
Outpaint には次の必須パラメータがあります。
image – (文字列) アウトペイントする Base64 イメージ。画像のすべての辺を 64 ピクセル以上にする必要があります。合計ピクセル数が 9,437,184 ピクセルを超えることはできません。画像のアスペクト比は 1:2.5 と 2.5:1 の間にする必要があります。サポートされている形式: jpeg、png、webp。
注記
少なくとも 1 つのアウトペイント方向 (左、右、上、下) に 0 以外の値を指定する必要があります。最高品質の結果を得るには、アウトペイント方向を選択するときは、元のイメージの構成とコンテンツを考慮してください。
以下のパラメータはオプションです。
prompt – 出力イメージに表示する内容。要素、色、件名を明確に定義する強力でわかりやすいプロンプトは、より良い結果につながります。特定の単語の重みを制御するには、形式 (word:weight) を使用します。ここで、word は重みを制御する単語、weight は値です。値 0 と 1.0 では単語の強調が軽減され、値 1.1 と 2 では単語 が強調されました。例えば、(青:0.3) はクリアな青い空を意味しますが、(緑:1.8) は青と緑からなるが青よりも緑が多い空を意味します。最小 0 文字、最大 10,000 文字です。
style_preset – (文字列) 画像モデルを特定のスタイルに導きます。列挙型: 3d-model、analog-film、anime、cinematic、comic-book、digital-art、enhance、fantasy-art、isometric、line-art、low-poly、modeling-compound、neon-punk、origami、photographic、pixel-art、tile-texture。
seed – (数値) 生成の「ランダム化」のガイドに使用される特定の値。(このパラメータを省略するか、0 を渡してランダムシードを使用します)。範囲は 0~4294967294 です。デフォルトは 0 です。
output_format – (文字列) 生成されたイメージのコンテンツタイプを指定します。列挙型: jpeg、png、webp。デフォルトは png です。
創造性 – (数値) イメージをアウトペイントするときのモデルの創造性を示します。値を大きくすると、アウトペイント中によりクリエイティブなコンテンツがイメージに追加されます。範囲は 0.1~1.0 です。デフォルトは 0.5 です。
left – (整数) 画像の左側にアウトペイントするピクセル数。少なくとも 1 つのアウトペインティング方向には、ゼロ以外の値を指定する必要があります。範囲は 0~2000 です。Detault 0。
right – (整数) イメージの右側にアウトペイントするピクセル数。少なくとも 1 つのアウトペインティング方向には、ゼロ以外の値を指定する必要があります。範囲は 0~2000 です。Detault 0。
up – (整数) イメージの上部にアウトペイントするピクセル数。少なくとも 1 つのアウトペインティング方向には、ゼロ以外の値を指定する必要があります。範囲は 0~2000 です。Detault 0。
down – (整数) イメージの下部にアウトペイントするピクセル数。少なくとも 1 つのアウトペインティング方向には、ゼロ以外の値を指定する必要があります。範囲は 0~2000 です。Detault 0。
次の表は、Outpaint オペレーションの入力イメージと出力イメージを示しています。
|
Input |
Output |
|---|---|
Willemijn Doelman |
|
検索および再配色を使用では、プロンプトを使用して画像内の特定のオブジェクトの色を変更できます。このサービスは、マスクを必要としない特定のバージョンのインペインティングです。これにより、オブジェクトが自動的にセグメント化され、プロンプトでリクエストされた色を使用して再配色されます。
検索および再配色には、次の必須パラメータがあります。
prompt – 出力イメージに表示する内容。要素、色、件名を明確に定義する強力でわかりやすいプロンプトは、より良い結果につながります。特定の単語の重みを制御するには、形式 (word:weight) を使用します。ここで、word は重みを制御する単語、weight は値です。値 0 と 1.0 では単語の強調が軽減され、値 1.1 と 2 では単語 が強調されました。例えば、(青:0.3) はクリアな青い空を意味しますが、(緑:1.8) は青と緑からなるが青よりも緑が多い空を意味します。最小 0 文字、最大 10,000 文字です。
image – (文字列) 再色する Base64 イメージ。画像のすべての辺を 64 ピクセル以上にする必要があります。合計ピクセル数が 9,437,184 ピクセルを超えることはできません。画像のアスペクト比は 1:2.5 と 2.5:1 の間にする必要があります。サポートされている形式: jpeg、png、webp。
select_prompt – (文字列) イメージ内で検索する内容の簡単な説明。最大 10,000 文字。
以下のパラメータはオプションです。
style_preset – (文字列) 画像モデルを特定のスタイルに導きます。列挙型: 3d-model、analog-film、anime、cinematic、comic-book、digital-art、enhance、fantasy-art、isometric、line-art、low-poly、modeling-compound、neon-punk、origami、photographic、pixel-art、tile-texture。
negative_prompt – (文字列) 出力イメージに表示したくない内容を説明するテキストのぼかし。これはアドバンスド機能です。最大 10,000 文字。
seed – (数値) 生成の「ランダム化」のガイドに使用される特定の値。(このパラメータを省略するか、0 を渡してランダムシードを使用します)。範囲は 0~4294967294 です。デフォルトは 0 です。
output_format – (文字列) 生成されたイメージのコンテンツタイプを指定します。列挙型: jpeg、png、webp。デフォルトは png です。
grow_mask – マスクのエッジを、指定したピクセル数だけすべての方向に外側に移動します。マスクの周囲の拡張領域がぼやけ、インペイントされたコンテンツと元の画像間の遷移を滑らかにすることができます。範囲は 0~20 です。デフォルトは 5 です。インペイントされたコンテンツの周囲にシームや粗いエッジがある場合は、このパラメータを試してください。過剰に大きくすると、マスク内の細かいディテールが不明瞭になったり、近くのマスクされた領域がつながったりする可能性がある点に注意してください。
次の表は、検索および再色オペレーションの入力イメージと出力イメージを示しています。使用されるプロンプトはピンクのジャケットです。
|
Input |
Output |
|---|---|
Stable Image Ultra によって生成された「インポータージャケットを着ている男性」、Sanwal Yousaf によるプロンプトと編集。CC BY 4.0 |
|
検索および置換では、検索プロンプトを使用して、置換するオブジェクトをシンプルな言語で識別できます。サービスはオブジェクトを自動的にセグメント化し、マスクがなくてもプロンプトでリクエストされたオブジェクトに置換します。
検索および置換には、次の必須パラメータがあります。
prompt – 出力イメージに表示する内容。要素、色、件名を明確に定義する強力でわかりやすいプロンプトは、より良い結果につながります。特定の単語の重みを制御するには、形式 (word:weight) を使用します。ここで、word は重みを制御する単語、weight は値です。値 0 と 1.0 では単語の強調が軽減され、値 1.1 と 2 では単語 が強調されました。例えば、(青:0.3) はクリアな青い空を意味しますが、(緑:1.8) は青と緑からなるが青よりも緑が多い空を意味します。最小 0 文字、最大 10,000 文字です。
image – (文字列) 再色する Base64 イメージ。画像のすべての辺を 64 ピクセル以上にする必要があります。合計ピクセル数が 9,437,184 ピクセルを超えることはできません。画像のアスペクト比は 1:2.5 と 2.5:1 の間にする必要があります。サポートされている形式: jpeg、png、webp。
search_prompt – (文字列) イメージにペイントする内容の簡単な説明。最大 10,000 文字。
以下のパラメータはオプションです。
style_preset – (文字列) 画像モデルを特定のスタイルに導きます。列挙型: 3d-model、analog-film、anime、cinematic、comic-book、digital-art、enhance、fantasy-art、isometric、line-art、low-poly、modeling-compound、neon-punk、origami、photographic、pixel-art、tile-texture。
negative_prompt – (文字列) 出力イメージに表示したくない内容を説明するテキストのぼかし。これはアドバンスド機能です。最大 10,000 文字。
seed – (数値) 生成の「ランダム化」のガイドに使用される特定の値。(このパラメータを省略するか、0 を渡してランダムシードを使用します)。範囲は 0~4294967294 です。デフォルトは 0 です。
output_format – (文字列) 生成されたイメージのコンテンツタイプを指定します。列挙型: jpeg、png、webp。デフォルトは png です。
grow_mask – マスクのエッジを、指定したピクセル数だけすべての方向に外側に移動します。マスクの周囲の拡張領域がぼやけ、インペイントされたコンテンツと元の画像間の遷移を滑らかにすることができます。範囲は 0~20 です。デフォルトは 5 です。インペイントされたコンテンツの周囲にシームや粗いエッジがある場合は、このパラメータを試してください。過剰に大きくすると、マスク内の細かいディテールが不明瞭になったり、近くのマスクされた領域がつながったりする可能性がある点に注意してください。
次の表は、検索および置換オペレーションの入力イメージと出力イメージを示しています。使用されるプロンプトは、ジャケットです。
|
Input |
Output |
|---|---|
Stable Image Ultra によって生成された「秋のセーターを着た女性モデル」。Sanwal Yousaf によるプロンプトと編集。CC BY 4.0 |
|
消去では、バックグラウンドの一貫性をインテリジェントに維持しながら、画像マスクを使用して不要な要素を削除できます。
消去には、次の必須パラメータがあります。
image – (文字列) 消去する Base64 イメージ。画像のすべての辺を 64 ピクセル以上にする必要があります。合計ピクセル数が 9,437,184 ピクセルを超えることはできません。画像のアスペクト比は 1:2.5 と 2.5:1 の間にする必要があります。サポートされている形式: jpeg、png、webp。
以下のパラメータはオプションです。
seed – (数値) 生成の「ランダム化」のガイドに使用される特定の値。(このパラメータを省略するか、0 を渡してランダムシードを使用します)。範囲は 0~4294967294 です。デフォルトは 0 です。
output_format – (文字列) 生成されたイメージのコンテンツタイプを指定します。列挙型: jpeg、png、webp。デフォルトは png です。
mask – (文字列) ピクセル単位でインペイントプロセスの強度を制御します。2 番目のイメージ (このパラメータに渡されます) またはイメージパラメータのアルファチャネルを介して制御できます。
マスクを渡す – このパラメータに渡されるイメージは、任意のピクセルで、特定のピクセルの暗さまたは明るさに基づいてインペイントの強度を表す白黒のイメージである必要があります。完全に黒いピクセルはインペインティング強度を表し、完全に白いピクセルは最大強度を表します。マスクのサイズが画像パラメータと異なる場合、マスクは自動的にサイズ変更されます。
アルファチャネルサポート – 明示的なマスクを指定しない場合、マスクはイメージパラメータのアルファチャネルから取得されます。透明ピクセルはインペイントされ、不透明ピクセルは保持されます。アルファチャネルを含む画像がマスクとともに指定される場合、マスクが優先されます。
grow_mask – マスクのエッジを、指定したピクセル数だけすべての方向に外側に移動します。マスクの周囲の拡張領域がぼやけ、インペイントされたコンテンツと元の画像間の遷移を滑らかにすることができます。範囲は 0~20 です。デフォルトは 5 です。インペイントされたコンテンツの周囲にシームや粗いエッジがある場合は、このパラメータを試してください。過剰に大きくすると、マスク内の細かいディテールが不明瞭になったり、近くのマスクされた領域がつながったりする可能性がある点に注意してください。
注記
最適な消去結果を得るには、マスクが削除する領域を正確に定義していることを確認してください。明示的なマスクが指定されていない場合、サービスでは入力画像のアルファチャネルが使用されます。両方が指定されている場合、マスクが優先されます。
次の表は、消去オペレーションの入力画像と出力画像を示しています。
|
Input |
マスク |
Output |
|---|---|---|
Stable Image Ultra によって生成された「学生用デスク」。Sanwal Yousaf によるプロンプトと編集。CC BY 4.0 |
|
|
背景の削除を使用すると、被写体を背景から正確に分離できます。
背景の削除には、次の必須パラメータがあります。
image – (文字列) 背景を削除する Base64 イメージ。画像のすべての辺を 64 ピクセル以上にする必要があります。合計ピクセル数が 9,437,184 ピクセルを超えることはできません。画像のアスペクト比は 1:2.5 と 2.5:1 の間にする必要があります。サポートされている形式: jpeg、png、webp。
以下のパラメータはオプションです。
output_format – (文字列) 生成されたイメージのコンテンツタイプを指定します。列挙型: jpeg、png、webp。デフォルトは png です。
次の表は、背景の削除オペレーションの入力画像と出力画像を示しています。
|
Input |
Output |
|---|---|
Stable Image Ultra によって生成された「秋のセーターを着た女性モデル」。Sanwal Yousaf によるプロンプトと編集。CC BY 4.0 |
|
コントロール
次のセクションでは、Stability AI Image Services のコントロールについて説明します。
手描きの大まかなスケッチを、正確なコントロールで洗練された出力に引き上げます。非スケッチイメージの場合、コントロールスケッチでは、イメージ内の輪郭線とエッジを使用して、最終的な外観を詳細に操作できます。
コントロールスケッチには、次の必須パラメータがあります。
prompt – 出力イメージに表示する内容。要素、色、件名を明確に定義する強力でわかりやすいプロンプトは、より良い結果につながります。特定の単語の重みを制御するには、形式 (word:weight) を使用します。ここで、word は重みを制御する単語、weight は値です。値 0 と 1.0 では単語の強調が軽減され、値 1.1 と 2 では単語 が強調されました。例えば、(青:0.3) はクリアな青い空を意味しますが、(緑:1.8) は青と緑からなるが青よりも緑が多い空を意味します。最小 0 文字、最大 10,000 文字です。
image – (文字列) スケッチの Base64 イメージ。画像のすべての辺を 64 ピクセル以上にする必要があります。合計ピクセル数が 9,437,184 ピクセルを超えることはできません。画像のアスペクト比は 1:2.5 と 2.5:1 の間にする必要があります。サポートされている形式: jpeg、png、webp。
以下のパラメータはオプションです。
control_strength – (数値) イメージが生成に与える影響、または制御の程度。0 から 1 の間の浮動小数点で表されます。0 は影響が最小、1 は影響が最大です。デフォルトは 0.7 です。
negative_prompt – (文字列) 出力イメージに表示したくない内容を説明するテキストのぼかし。これはアドバンスド機能です。最大 10,000 文字。
seed – (数値) 生成の「ランダム化」のガイドに使用される特定の値。(このパラメータを省略するか、0 を渡してランダムシードを使用します)。範囲は 0~4294967294 です。デフォルトは 0 です。
output_format – (文字列) 生成されたイメージのコンテンツタイプを指定します。列挙型: jpeg、png、webp。デフォルトは png です。
style_preset – イメージモデルを特定のスタイルに向けてガイドします。列挙型: 3d-model、analog-film、anime、cinematic、comic-book、digital-art、enhance、fantasy-art、isometric、line-art、low-poly、modeling-compound、neon-punk、origami、photographic、pixel-art、tile-texture。
次の表は、コントロールスケッチ呼び出しの入力イメージと出力イメージを示しています。使用されるプロンプトは、山と河川の背景が近くに流れている家です。
|
Input |
Output |
|---|---|
Sanwal Yousaf による「家、山、河川のスケッチ」。CC BY 4.0 |
|
コントロール構造では、入力画像の構造を維持しながら画像を生成できます。これは、シーンの再作成やモデルからのキャラクターのレンダリングなど、高度なコンテンツ作成シナリオに特に役立ちます。
コントロール構造には、次の必須パラメータがあります。
prompt – 出力イメージに表示する内容。要素、色、件名を明確に定義する強力でわかりやすいプロンプトは、より良い結果につながります。特定の単語の重みを制御するには、形式 (word:weight) を使用します。ここで、word は重みを制御する単語、weight は値です。値 0 と 1.0 では単語の強調が軽減され、値 1.1 と 2 では単語 が強調されました。例えば、(青:0.3) はクリアな青い空を意味しますが、(緑:1.8) は青と緑からなるが青よりも緑が多い空を意味します。最小 0 文字、最大 10,000 文字です。
image – (文字列) スケッチの Base64 イメージ。画像のすべての辺を 64 ピクセル以上にする必要があります。合計ピクセル数が 9,437,184 ピクセルを超えることはできません。画像のアスペクト比は 1:2.5 と 2.5:1 の間にする必要があります。サポートされている形式: jpeg、png、webp。
以下のパラメータはオプションです。
control_strength – (数値) イメージが生成に与える影響または制御の程度。0 から 1 の間の浮動小数点で表されます。0 は影響が最小、1 は影響が最大です。デフォルトは 0.7 です。
negative_prompt – (文字列) 出力イメージに表示したくない内容を説明するテキストのぼかし。これはアドバンスド機能です。最大 10,000 文字。
seed – (数値) 生成の「ランダム化」のガイドに使用される特定の値。(このパラメータを省略するか、0 を渡してランダムシードを使用します)。範囲は 0~4294967294 です。デフォルトは 0 です。
output_format – (文字列) 生成されたイメージのコンテンツタイプを指定します。列挙型: jpeg、png、webp。デフォルトは png です。
style_preset – イメージモデルを特定のスタイルに向けてガイドします。列挙型: 3d-model、analog-film、anime、cinematic、comic-book、digital-art、enhance、fantasy-art、isometric、line-art、low-poly、modeling-compound、neon-punk、origami、photographic、pixel-art、tile-texture。
次の表は、コントロール構造オペレーションの入力イメージと出力イメージを示しています。使用されるプロンプトは、モーション生成のスパークがシーンを照らす超現実的な構造です。
|
Input |
Output |
|---|---|
Pawel L |
|
スタイルガイドでは、入力イメージからスタイル要素を抽出できます。これらを使用して、プロンプトに基づいて出力イメージの作成をガイドします。その結果、入力画像と同じスタイルの新しい画像が作成されます。
スタイルガイドには、次の必須パラメータがあります。
prompt – 出力イメージに表示する内容。要素、色、件名を明確に定義する強力でわかりやすいプロンプトは、より良い結果につながります。特定の単語の重みを制御するには、形式 (word:weight) を使用します。ここで、word は重みを制御する単語、weight は値です。値 0 と 1.0 では単語の強調が軽減され、値 1.1 と 2 では単語 が強調されました。例えば、(青:0.3) はクリアな青い空を意味しますが、(緑:1.8) は青と緑からなるが青よりも緑が多い空を意味します。最小 0 文字、最大 10,000 文字です。
image – (文字列) スケッチの Base64 イメージ。画像のすべての辺を 64 ピクセル以上にする必要があります。合計ピクセル数が 9,437,184 ピクセルを超えることはできません。画像のアスペクト比は 1:2.5 と 2.5:1 の間にする必要があります。サポートされている形式: jpeg、png、webp。
以下のパラメータはオプションです。
aspect_ratio – (文字列) 生成されたイメージのアスペクト比を制御します。このパラメータは、テキストからイメージへのリクエストにのみ有効です。デフォルトは 1:1 です。列挙型: 16:9、1:1、21:9、2:3、3:2、4:5、5:4、9:16、9:21。デフォルトは 1:1 です。
negative_prompt – (文字列) 出力イメージに表示したくない内容を説明するテキストのぼかし。これはアドバンスド機能です。最大 10,000 文字。
seed – (数値) 生成の「ランダム化」のガイドに使用される特定の値。(このパラメータを省略するか、0 を渡してランダムシードを使用します)。範囲は 0~4294967294 です。デフォルトは 0 です。
output_format – (文字列) 生成されたイメージのコンテンツタイプを指定します。列挙型: jpeg、png、webp。デフォルトは png です。
fidelity – (数値) 出力イメージのスタイルが入力イメージのスタイルとどの程度似ているか。範囲は 0~1 です。デフォルトは 0.5 です。
style_preset – イメージモデルを特定のスタイルに向けてガイドします。列挙型: 3d-model、analog-film、anime、cinematic、comic-book、digital-art、enhance、fantasy-art、isometric、line-art、low-poly、modeling-compound、neon-punk、origami、photographic、pixel-art、tile-texture。
次の表は、スタイルガイド呼び出しの入力イメージと出力イメージを示しています。使用されるプロンプトは、近代大都市のワイドショットです。
|
Input |
Output |
|---|---|
Steven Johnson |
|
スタイル転送では、参照スタイル画像からターゲット画像に視覚的特性を適用できます。スタイルガイドサービスは、入力イメージからスタイル要素を抽出し、それらを使用してプロンプトに基づいて出力イメージの作成をガイドします。スタイル転送は、元のコンポジションを保持しながら、特に既存のコンテンツを変換します。このツールは、複数のアセット間で一貫したコンテンツを作成するのに役立ちます。
スタイル転送には、次の必須パラメータがあります。
init_image – (文字列) スタイルを変更するサブジェクトを含む Base64 イメージ。画像のすべての辺を 64 ピクセル以上にする必要があります。合計ピクセル数が 9,437,184 ピクセルを超えることはできません。画像のアスペクト比は 1:2.5 と 2.5:1 の間にする必要があります。サポートされている形式: jpeg、png、webp。
style_image – (文字列) スタイルを変更するサブジェクトを含む Base64 イメージ。画像のすべての辺を 64 ピクセル以上にする必要があります。合計ピクセル数が 9,437,184 ピクセルを超えることはできません。画像のアスペクト比は 1:2.5 と 2.5:1 の間にする必要があります。サポートされている形式: jpeg、png、webp。
以下のパラメータはオプションです。
prompt – (文字列) 出力イメージに表示する内容です。要素、色、件名を明確に定義する強力でわかりやすいプロンプトは、より良い結果につながります。特定の単語の重みを制御するには、形式 (word:weight) を使用します。ここで、word は重みを制御する単語、weight は値です。値 0 と 1.0 では単語の強調が軽減され、値 1.1 と 2 では単語 が強調されました。例えば、(青:0.3) はクリアな青い空を意味しますが、(緑:1.8) は青と緑からなるが青よりも緑が多い空を意味します。
negative_prompt – (文字列) 出力イメージに表示したくない内容を説明するテキストのぼかし。これはアドバンスド機能です。最大 10,000 文字。
seed – (数値) 生成の「ランダム化」のガイドに使用される特定の値。(このパラメータを省略するか、0 を渡してランダムシードを使用します)。範囲は 0~4294967294 です。デフォルトは 0 です。
output_format – (文字列) 生成されたイメージのコンテンツタイプを切り捨てます。列挙型: jpeg、png、webp。デフォルトは png です。
composition_fidelity – (数値) 出力イメージのスタイルが入力イメージのスタイルとどの程度似ているか。範囲は 0~1 です。デフォルトは 0.9 です。
style_strength – (数値) ノイズ除去とも呼ばれ、このパラメータは style_image パラメータが生成されたイメージに与える影響を制御します。値が 0 の場合、入力と同じイメージが生成されます。値が 1 の場合、イメージを全く渡さないような動作を行います。範囲は 0~1 です。デフォルトは 1 です。
change_strength – (数値) 元のイメージを変更する量。範囲は 0.1~1 です。デフォルトは 0.9 です。
次の表は、スタイル転送呼び出しの入力画像と出力画像を示しています。
|
Input |
[Style] (スタイル) |
Output |
|---|---|---|
Simon Berger |
|