ロードマップ
更新: 2026-07-15。実装状態はレビュー済みのコードとテストを基準に更新する。
思想は philosophy.md、製品として保証する境界はdocs/specs/product-contract-v1.md、詳細計画はdocs/specs/productization-v1.md を正とする。
AI作業を shirusu 経由にするだけで、必要なガードと証跡が自動で揃う。
現在地
- P0: 設計・用語固定 — 完了
- P1: post-hoc安全判定の縦切り — 完了
- P2: 初期7ルール + 最小Run detail — 完了
- P3: GUI中核フロー — 完了
- P4: GUI全画面 + 選択的preflight設計 — 完了 (A〜E全slice実装・検証済み)
- 次の検証点 — 1〜2チームでP2.5/P3/P4先行需要検証。外部検証結果はまだ未入力
新しいcheckはobserveから始める。誤検知と通常作業への影響を検証せず、
新しい実行停止へ昇格しない。
完成済みの基盤
AI作業の実行
- think / make / decideの3処理タイプ
- 能力ロールによるモデル抽象化とfallback
- mock / Claude / Codex / Antigravity / Ollama / GLM runner
- AIレビュー、リトライ、モデル格上げ、人間確認
- depth(quick / standard / deep / extreme)
- best-of、Reviewer多数決、fanoutによる並列処理
- 対話モード、セッション継続、steering
ファイル変更と人間の確定境界
- 明示承認されたwrite mode
- task要求、step適格性、承認、public scopeの4条件
- Git checkpoint、変更一覧、diff stat
- forbidden read / forbidden write
- commit、push、deploy、送信、公開は人間に残す
KOKUINと証跡
- run-summary / decision-log / approval-required
- runner、モデル、scope、log level、レビュー、変更差分、人間判断の記録
- stats、履歴ナレッジ、feedback
- 月次audit export(Markdown / JSONL)
- 実測・概算を分けたtoken / cost記録
- retention clean
- schema v0.2履歴保持とv0.3
GUIとHub
- Dashboard / New task / Runs / Run detail
- Hub / Knowledge / Settings / Connectors / Environment
- 全プロジェクトrun集約
- task title / file path横断検索
- ファイルから関与runを逆引き
- failed runの記録、Hub rebuild、test run隔離
- v2 read model (Dashboard / Runs / Hub / Knowledge / Settings / Connectors / Environment)・ 共通component (filter / pagination / empty / notice / truncated)・cursor pagination・ 8画面×状態の横断QA test (P4)
外部ソース
- HTTPS、許可ドメイン、redirect、サイズ、timeoutを検証するconnector guard
- Backlog課題・コメントの読み取りとephemeral knowledge保存
- Box / Google Driveは設定UIと境界設計のみ。実接続は未実装
P0: 設計・用語固定 — 完了
成果:
- エンジニア向け安全ゲートウェイとして製品軸を固定
- 「保証すること / しないこと」をProduct Contractへ明文化
- 通常UI用語と内部IDを分離
verdict=blockと実停止effect=preventedを分離- checksの正本を
RunSummary.complianceに固定 - API・schema・内部IDを表示都合で変更しない方針を固定
通常UIでは次を使う。
| 内部状態 | 通常表示 |
|---|---|
| pass | 問題なし |
| warn | 確認あり |
| block + posthoc | 停止判定 |
| block + prevented | 実行前に停止 |
| legacy | 判定なし |
P1: post-hoc安全判定の縦切り — 完了
完成したデータ経路:
RunSummary.compliance
├─ decision-log
├─ toRunEntry → Hub
└─ audit export
実装済み:
- DATA-002: private / local-onlyと外部AI利用の矛盾
- REVIEW-001:
human_review_reasonsの構造化 - EVIDENCE-001: KOKUIN必須証拠
- pass / warn / blockの決定的集約
- effect=none / posthoc / preventedの分離
- 成功run・失敗runへの保存
- legacy runをpassへ推定しない互換処理
- policy version / hash不明時のwarn
- Hub集計・rebuild・audit export
P1は実行後の判定と記録であり、新しいpreflight停止やCLI終了コード変更は行わない。
P2: 初期7ルール + 最小Run detail — 完了
初期7ルール
- DATA-001: 禁止ファイル・秘密情報の外部送信
- DATA-002: private / local-onlyと外部runnerの矛盾
- DATA-003: restrictedで未許可のプロジェクト参照
- WRITE-001: write承認条件の不足
- REVIEW-001: 高リスク成果物の人間確認不足
- TEST-001: コード変更後のテスト証拠不足
- EVIDENCE-001: KOKUIN必須証拠の欠落
v2 Run Overview
- 保存済みcomplianceを画面用JSONへ変換
- GUI、Hub、auditで判定を再計算しない
- legacyは「判定なし」
- required actions、変更、テスト、レビュー、利用AI、usageを構造化
- 秘密値をmaskし、既存
/api/*を維持
最小Run detail
表示順:
- 成果物
- 安全判定
- 確認事項
- ファイル変更
- テスト結果
- レビュー・利用AI・技術詳細
完了条件:
- 7ルールの到達可能な状態をfixtureで検証
- 新規checkはすべてobserve-only
- post-hoc blockを「実行前に停止」と表示しない
- 生ログを開かず、成果物・要確認・変更・テスト状態を説明できる
- legacy runを問題なしと誤認させない
レビュー済み:
- 7ルール、v2 Run Overview、最小Run detailを実装
- 全テストと実ブラウザでpass / warn / post-hoc block / legacyを確認
- 700px幅で成果物・判定・確認事項・変更・テストの主要情報を確認
- 成果物内のraw HTMLを実行せず、文字列として表示することを確認
P2.5: 先行需要検証 — P2直後
まず1〜2チームへ実案件で触ってもらう。
確認すること:
- 「成果物 → 判定 → 確認事項」の順序が理解しやすいか
- 停止判定を実行前停止と誤解しないか
- reasonとremediationが次の行動につながるか
- 生ログなしで通常の承認判断ができるか
- 通常作業の邪魔にならないか
結果をP3のGUI改善と、将来のenforcement判断へ反映する。
P3: GUI中核フロー — 完了
対象:
- Dashboard
- New task
- Runs
- Run detail
詳細設計:
docs/specs/p3-gui-core-flow.md
目標:
- 初見ユーザーが詳細設定を開かずにrunを開始できる
- 完了画面から要確認事項を10秒以内に発見できる
- 先行検証で見つかった理解阻害を解消する
実装済み:
- Dashboard / Runs用v2 read model、server-side filter / cursor pagination、test run隔離
- native ES Modulesと外部CSSへの分割、CSP、静的assetのpath / symlink境界
- New taskの「依頼入力 → 下書き確認 → 実行」と検索式knowledge選択
- scope / log-level / depthを含む入力状態の保持
- Run detailのapprove / fix / reject、comment redaction、artifact / Hub / history同期
- required action定義のRun detail / Hub / Dashboard / Runs / feedback共通化
- CLI
/feedbackとGUI APIの保存service統一 - 700pxでのRunsカード表示とページ横overflow防止
レビュー済み:
- 全381テスト成功、
git diff --check成功 - 実ブラウザで1280px / 700px、New task → mock run、Runs → Run detailを確認
- post-hoc blockの表示、non-overridable approve無効、feedbackコメント保存を確認
- raw HTML非実行、CSP違反なし、tokenなしの認証エラー表示を確認
未完了:
- P2.5の外部チーム検証結果は未入力。需要・理解度の検証完了を意味しない
P4: GUI全画面 + 選択的preflight設計 — 完了
状態 (2026-07-15): 5 slice (P4-A〜E) 全て実装・検証済み。
- 詳細設計正本:
docs/specs/p4-gui-all-screens.md - 実行手順:
docs/handoffs/p4-shirusu-glm-runbook.md - 実装タスク:
tasks/p4-a-common-gui.md〜tasks/p4-e-qa-enforcement-docs.md - 運用文書:
docs/specs/preflight-enforcement-plan.md(gate実態表・昇格基準・preflight未決事項)
対象:
- Hub / Knowledge / Settings
- Connectors / Environment
- 共通ナビゲーション、通知、エラー、空状態
- 既存gateのpreflight check可視化 (設計のみ。実装しない)
- 新規ruleをenforceへ昇格する基準と承認手順 (文書化)
実装済み:
- 共通GUI基盤 (P4-A): filterBar / paginationBar / emptyState / truncatedValue / notices コンポーネント、8タブ日本語表示、401認証パネル、レスポンシブ (360/700/1280px)
- Hub v2 (P4-B): v2 read model、cursor pagination、attention集計、長path省略、横断run overview
- Knowledge v2 (P4-C): filter (q/scope/persistence)・preview・逆引き (knowledge filter)・追加フォーム
- Settings / Connectors / Environment (P4-D): 3画面のv2化、保存往復、token再表示なし
- 横断QA + 運用文書 (P4-E):
test/gui-states-qa.test.mjs(8画面×状態網羅)・docs/specs/preflight-enforcement-plan.md
設計で固定した判断 (実装どおり):
POST /api/v2/task/preflightは実装しない (P2.5外部検証の結果入力後に再判断)- 書き込みAPIは既存v1 PUTを維持し、v2はread modelのみ追加
- Policy Pack freshnessは機構未実装のため
unavailable表示 (P5まで) - 新しい実行停止・enforcement・
status: blockedは存在しない (compliance 7ルールはobserve/posthoc維持)
レビュー済み:
- 全テスト成功 (659+)、
git diff --check成功 - block+posthoc が「実行前に停止」と表示されないことをQA testで固定 (effect偽装禁止)
- 各画面のloading / empty / populated / long title / long path / 100+件 / verdict 5種 / failed / unauthorized をfixture検証
未完了:
- P2.5の外部チーム検証結果は未入力。需要・理解度の検証完了を意味しない
- 実ブラウザでの最終人間検収 (保存操作E2E・verdict 6種同時表示等の一部項目) は 各sliceのverification reportに残り、全て完了とは限らない
P5: 日本向けPolicy Pack
成果物:
policy-packs/jp/sources.yml
policy-packs/jp/controls/
policy-packs/jp/packs/engineering-baseline.yml
policy-packs/jp/archive/
目標:
- 使用したpackの版とhashを各runへ保存
- 公的文書の更新をhash差分で検知
- 各checkから公式URL・版・該当節へ辿れる
- 文書更新だけで判定やenforcementを自動変更しない
- 利用条件未確認の原本を公開配布物へ自動同梱しない
P6: 導入と需要検証の拡大
shirusu init— 前倒しで実装済み (v0.8.1)。npm公開に伴い、外部ユーザーの 初回導線として先行実装した (サンプルタスク雛形の配置 +.gitignore設定、 既存ファイルは上書きしない)- 初回起動ウィザード
- サンプルrunと実runの分離
- P2.5を含め合計5チームで実案件検証
成功指標:
- インストール開始から初回run完了まで10分以内
- New taskの80%以上で詳細設定を変更しない
- 5チーム中3チームが翌週も利用する
- 1チーム以上が証跡をPR、顧客説明、社内確認に利用する
- 1チーム以上が有料継続の意思を示す
意図的に対象外
- SaaS化、組織ユーザー管理、SSO
- 自動commit / push / deploy / publish
- 外部サービスへの無承認書き戻し
- 本番環境操作
- LLM回答を最終コンプライアンス判定にすること
- 全法令への準拠保証
- Policy Pack YAMLからの任意コード実行
- 現行資産を捨てた0からの再構築