モデルの精度を上げる代わりに、結果をたたき台として使うことにした

· Product · 한국어 · English

AIエージェントから、写真に写った人物の特徴を抽出する実験の結果が届いた。テストに使った10枚の写真は、すべて当時の成功基準を満たしていた。ただ、どの写真の抽出結果にも4〜8個の誤った特徴が含まれていた。口ひげのない人の写真なのに、moustache が候補として出てきたこともあった。

当時の基準に照らせば、成功ではあった。けれど、そのまま画面に出せる品質ではなかった。

最初に作りたかったのは、写真からキャラクター生成に必要な特徴を抜き出してくれる小さなツールだった。ただ、最初から条件が一つあった。自分の写真の元画像を、外部のAIサービスやサーバーにアップロードしたくなかった。かといって、髪の長さ、髪の色、眼鏡、服、表情といった特徴を最初から一つずつ選ぶのも面倒だった。

そこで、元画像をサーバーに送らず、ブラウザ上でローカルモデルが限られた特徴を提案する方法を試してみることにした。モデルの候補、評価方法、成功基準はAIエージェントが提案して具体化し、私はその内容を見て承認した。実際の実験もAIエージェントが担当した。

最初の結果を見たときは、精度がどうこうというより、ブラウザで本当に動いたこと自体が面白かった。

「あれ、とりあえず動くんだ。面白いな。」

成功したのに、何かおかしかった

最初の成功基準は単純だった。

写真1枚から正確な特徴が5個以上出ればクリア。

問題は、私が承認したこの基準が、合っている特徴しか数えていなかったことだ。口ひげのない人に moustache が出ても、ほかの特徴が5個合っていればクリアだった。

そこで次の評価からは、正しく抽出できた特徴だけでなく、誤って抽出した特徴や、見落とした重要な特徴も評価対象にするよう、基準を見直すことにした。新しい基準で評価し直すと、最初の10枚はどれも基準を満たさなかった。新たに選んだ10枚で何度か調整しても、基準を満たしたのは多くて1枚だけだった。

もっと良いモデルを使えばいいのでは

より強力なモデルをサーバーで動かす方法もある。しかしそのためには、写真をサーバーに送らなければならなかった。写真の元画像を外部に送らないという条件を捨てれば、自分が作りたかったものとは別のツールになる。

そのときAIエージェントが提案したのは、モデルの出力をそのまま正解として扱うのではなく、人が後から修正できる初期値として使う方法だった。モデルの調整に使っていない別の写真では、15項目のうち平均7〜8個は合っていた。正解として使うには不十分だったが、全項目をゼロから選ぶ手間を減らすには使えそうだった。

だから、その提案を受け入れた。

モデルの結果をフォームの初期値として使った

最初に考えていたやり方はこうだった。

写真からあなたの特徴を正確に抽出します。

変えた後は、こうなった。

写真を見て、特徴フォームを先に埋めます。間違っているところだけ直してください。

モデルが選んだ値は、すぐに確認して修正できるようにした。同じ誤りでも、抽出結果としてそのまま見せれば間違った答えになる。フォームの初期値なら、直せばいい項目になる。


Character Prompt を試してみる

写真の元画像はサーバーに送らず、ブラウザで処理します。間違った値が出ることがあります。必要なだけ直して使ってみてください。