【AI編】作ってきたもの・できること

【AI編】作ってきたもの・できること

記事
IT・テクノロジー
こんにちは。
ソフトウェアの品質保証に幅広く関わってきたエンジニアです。

この記事では、AIまわりで作ってきたハーネスやツールを一覧にしました。
ひとつひとつの中身よりも、「こういうことを頼める人なんだな」が伝われば嬉しいです。

【全てに共通している考え方】

共通している4つの考え方_グラスモーフィズム.png

何を開発するときも、この4つを守っています。
AIに任せる部分と、ルールで決める部分を分けて組むことを基本としています。

【こんなご相談に乗れます】

・AIの回答品質を確かめたい(チャットボット、RAG、ワークフローなど)
・AIを使って、テスト設計やテスト作成を楽にしたい
・AIが書いたコードやテストを、AI任せにせず確かめたい
・AIの判断がどれくらい安定しているか、偏っていないかを測りたい
・エージェントのフレームワークやモデルを比べて選びたい
・AIを組み込んだアプリが攻撃にどこまで耐えるかを確かめたい
・チームにAIの使い方を教えてほしい

【作ってきたハーネス】

ここで言うハーネスとは、AIに作業をさせて、その結果をルールで確かめるところまでを一つにまとめた仕組みです。

・仕様書の矛盾や書き漏れを見つける
・品質特性(ISO/IEC 25010)を軸に、リスクとテスト観点を漏れなく洗い出す
・正解が分からなくても「おかしい」と言える検査(言い換えたり順番を変えたりしても答えが変わらないか、など)
・テスト設計エージェントを回し続け、出力の穴を見つけて直していくループ
・不具合の原因を分類して分析(ODC分析)
・テストの合否、記録の抜け、設計書とのズレを3方向から突き合わせる検査
・見つかった脆弱性をAIに直させ、ルールで確かめてから修正案を出す
・AIアプリへの攻撃と防御を、自動でぶつけ合わせる
・上のハーネスが共通で使うコア(判定の根拠を残す台帳、エラーの扱い、AIとのやり取りの記録と再生など)

【作ってきたツール】

・仕様書からテスト設計を作り、網羅性を測りながら上げていくツール
・AIワークフローの出力を評価し、失敗の原因と修正案まで返すツール
・AIが書いたコードに、テスト生成・レビュー・修復をかけるマルチエージェントの仕組み
・変更に関係するテストだけを選び、手薄なところにAIでテストを足す仕組み
・UIテストの失敗をAIが仕分けし、足りないテストを補う仕組み
・UIが変わってもテストが自分で追従し、直すコストが回を追うごとに下がるかを測る仕組み
・E2Eテストのコードをチームで均一化し、多段チェックする仕組み
・E2Eテストの要素の指定方法を、AIが安定しやすい順に提案するWebツール
・画面操作の前後の変化から、確認すべき項目をAIが提案するWebツール
・自動テストの実行結果を集めて推移をグラフにし、AIが要約するダッシュボード
・MCPサーバーが申告している内容と、実際の動きのずれを見つける監査ツール
・開発資料をAIガバナンスの規制と照らし合わせて、リスクを根拠つきで示すツール
・技術に詳しくない方向けに、AIの使いどころを診断するツール
・RAGチャットボットの品質を、作る段階から運用中まで追い続けるサービスの設計(評価データ作り、自動採点、監視)
・LLMの入出力結果を継続的にモニタリングするツール

【比べてみたこと・測ってみたこと】

・エージェントフレームワーク3種を、テスト設計などQAの作業で比較
・TypeScript製とPython製のフレームワークを、同じ条件で比較
・AIにテストを書かせるとき、何を渡すと良いテストになるか調査
・AIの判断が、選択肢の並べ替えやヒントでどれくらい揺れるか(手元のモデルとAPIのモデルで比較)
・手元で動かすLLMを、評価で選んだ出力だけで鍛え直す実験
・特定の課題に対するモデルの性能比較

【教育してきたこと】

AI基礎、プロンプトエンジニアリング、コンテキストエンジニアリング、
QA4AI、AI4QA、CS4AI、ハーネスエンジニアリング、ループエンジニアリング、グラフエンジニアリングなど。

【最後に】

ここにないことでも、「こう事はできる?」とお気軽にお問合せください。
誠心誠意お答えいたします。
サービス数40万件のスキルマーケット、あなたにぴったりのサービスを探す