背景
SDK は単体メトリクス評価が中心で、CI で評価セットを実行し、閾値判定とレポート出力まで行う導線が弱い。
現状
- SDK には metric 単位の evaluate helper がある
- batch evaluation set、CI exit threshold、report artifact の導線は不足している
- 開発者向けユースケースを広げるには SDK / CI 連携が必要
対応方針
- 評価セット入力形式を定義する
- batch runner / CLI / example workflow のどれを MVP にするか決める
- 閾値判定と report artifact 出力を実装する
完了条件
- CI から評価セットを実行できる
- 閾値未満の場合に failure として扱える
- 結果を artifact として保存できる
関連コンテキスト
- SCREEN PoC / GENFLUX Evaluation 進化版に向けた改善タスク
- 既存コード確認済み repo:
prd-genflux-evaluation-backend, prd-genflux-evaluation-frontend, genflux-python-sdk
- 直接実装に入る前に、必要に応じて設計メモ・UI仕様・trace schema を残す
背景
SDK は単体メトリクス評価が中心で、CI で評価セットを実行し、閾値判定とレポート出力まで行う導線が弱い。
現状
対応方針
完了条件
関連コンテキスト
prd-genflux-evaluation-backend,prd-genflux-evaluation-frontend,genflux-python-sdk