■ こんなチームのためのサービスです
・ChatGPT/Claude等のAPIを使った機能をリリースしたが、出力品質のチェックが目視頼み
・プロンプトやモデルを変えるたびに「何が壊れたか分からない」
・評価データセットやテスト基準を作りたいが、何から始めるべきか分からない
・LLMの出力評価が特定メンバーの属人的な判断になっている
■ 提供内容(2週間・オンライン完結)
1. 現状診断(ビデオ通話60〜90分+診断シート納品)
評価の現状を10観点で棚卸しし、最も効果の大きい改善点を特定します
2. 評価設計書の作成
・測るべき品質軸と合否基準
・テストデータセットの方針(件数・作り方・エッジケースの集め方)
・LLMジャッジ(自動評価)の設計と、人間の判断との合わせ込み手順
・プロンプト変更時の回帰テストとCI組み込みの方針を、貴チームのプロダクトに合わせて設計・文書化します
3. 実装レビュー1回
■ 含まないもの
モデル自体の精度改善・fine-tuning、常駐対応(継続支援をご希望の場合は別途ご相談ください)
■ 進め方
ご購入前にダイレクトメッセージで、対象プロダクトの概要(何を作っているか・現在の評価方法)をお聞かせください。お力になれるか事前にお答えします。
■ 価格について
モニター価格30,000円(先着3チーム)。通常価格80,000円を予定しています。
モニター期間中は、匿名化した形での事例紹介にご協力をお願いする場合があります。
■ 担当について
現役でAI組み込みWebアプリケーションを開発しているソフトウェアエンジニアです。自身のプロダクトと複数チームの支援で、評価データセット構築・LLMジャッジ設計・CI組み込み・本番品質監視まで一通り実務で運用しています。
モニター特別料金となります。
初回ヒアリング後、実施可否を含めてご相談させていただきます。
お客様側でも並走して作業ができる方がいることをご確認ください。