AWP-LLM 核心架構與方法論

面向 RAG 最佳化、具備航空級防呆機制的 LLM 協作知識庫

探索技術細節

1. 核心理念:資料隔離與法庭級溯源

在處理 SAS 6.02 與 GLI 法規等極度嚴謹的領域時,傳統 LLM 最致命的弱點在於「語意幻覺 (Semantic Hallucination)」。為此,知識庫底層導入了原始文件不可變性 (Immutability)法庭級的證據溯源

🛡️ 原始文件不可變性 (Immutability)

所有的官方規範(如 SAS PDF、GLI PDF)皆置於隔離區,系統使用 SHA-256 Hash 進行極端防護。知識庫絕不篡改原文,所有的條目 (Entries) 都是對原文的「引用」與「詮釋」。

⚖️ 精確的義務層級 (Normative Obligation)

我們拒絕任何模糊描述。規範強制判定為 MUST (強制義務)、MAY (選擇性實作) 或 MUST_NOT (嚴格禁止)。若原文使用「描述性現在式」,系統強制將其降級為 UNRESOLVED,並透過 GSA 測試腳本的 Pass/Fail 行為做最終裁判。

🔗 法庭等級的證據溯源 (Traceability)

每條規範必須具備:精確的來源文件 source_id、精確至頁碼的 locator (如 §12.3, p.12-1),以及一字不漏的 keyword_excerpt (Semantic Grounding)。確保任何人都可一秒對照原文。

數位保險箱防護概念圖

2. 架構規範與實體資料夾設計

知識庫基於嚴格的 JSON Schema v5 運作。每個 Markdown 的 YAML Frontmatter 強制包含 30 餘項欄位 (涵蓋擁有者 owner_role、生命週期 lifecycle_status、驗證依據 gsat_mapping 等)。實體結構貫徹了「高內聚、低耦合」設計:

📂 awp-llm/ # 知識庫根目錄
  ├── 📄 STATUS.md # 中央儀表板,即時追蹤條目數量、卡關狀態與驗證進度
  ├── 📂 entries/ # 核心知識存放區 (YAML Metadata + Markdown)
  │   ├── requirements/ # REQ:SAS 協定規則 (如 AFT、Validation 等)
  │   ├── standards/ # GLI:第三方合規標準
  │   └── testing/ # TEST:測試腳本與實務驗證步驟
  ├── 📂 index/ # 檢索索引區
  │   └── 📄 wiki-index.json # 由工具自動編譯的 Canonical 索引樹,保證檢索不漏檔
  ├── 📂 schema/ # 格式定義區
  │   └── 📄 entry.schema.json # 嚴格定義 YAML 中 30 多項必填與選填欄位
  ├── 📂 tools/ # 自動化腳本區
  │   └── 📄 validate_*.py # 負責執行 400+ 項的 Schema 防呆與路徑測試
  ├── 📂 governance/ # 存放最高管理政策與轉換邏輯
  ├── 📂 reviews/ # 存放 awp-verifier 與 awp-doc-writer 歷次的交叉審查與修正報告
  └── 📂 cross-references/ # 獨立存放 GLI 條文與 SAS 行為的對應關聯 (Xref)
全像投影資料夾結構圖

3. 增刪 SOP 與代理人協作 (Multi-Agent Orchestration)

我們捨棄了傳統 Wiki「誰都能改」的混亂機制,改採 Builder ➔ Validator ➔ Reviewer ➔ Gater 四階段流水線,解決單一 AI 認知盲區:

  • AI 萃取起草 (Builder)

    gpt知識庫助手 從 PDF 提取邏輯,產出草稿 (DRAFT)。

  • 本機嚴格驗證 (Validator)

    經過 400+ 項單元測試。錯一個字元,系統立刻退件。

  • 專家交叉審查 (Cross-Review)

    交由 awp-verifier (邏輯挑剔專家) 與 awp-doc-writer 尋找邏輯漏洞。強制收集 ≥ 2 個獨立簽章 (verified_by >= 2)。

  • 編譯發布 (Index Build)

    重構索引樹,狀態晉升為 PUBLISHED。

🗑️ 安全刪除與過期追蹤 (Staleness Tracking)

知識庫不允許隨意物理刪除檔案,以防歷史檢索中斷。若條目過時,狀態改為 DEPRECATED 並重新編譯。此外,條目帶有 review_cadence_days (如 180 天),超時自動警示,徹底杜絕死知識。

AI Agent 協作概念圖

4. 面向 RAG 最佳化的高速路由架構

AWP-LLM 並非傳統給人類閱讀的文件,而是一套專為後端 AI (如 Bug-fixing Agent) 打造的半結構化資料庫 (Semi-structured Database)

⚡ O(1) 確定性檢索 (Deterministic Routing)

我們摒棄了傳統向量庫 (Vector DB) 常見的檢索失真。系統每次更新皆會編譯出 wiki-index.json 路由表,讓後端 Agent 能在 1 秒內精準定位並抽取所需的條文與狀態機。

🔗 Xref 有向無環圖 (DAG Topology)

透過 Cross-References (Xref) 機制,將 GLI 合規要求與 SAS 實務邏輯建立拓樸關聯。這讓 AI 進行除錯時,具備了從法規到實作的全局視野。

發光的 RAG 神經網路樹狀圖

5. 核心自動化工具鏈 (CI/CD Pipeline)

撐起這套嚴謹架構的,是我們自主研發的專屬自動化工具鏈。這使得知識管理具備了與軟體工程 (Software Engineering) 同等級的 CI/CD 測試強度:

  • validate_entries.py (單元測試守門員)

    每次更新皆觸發 400+ 項測試。針對 YAML 結構、屬性型別、甚至是路徑命名規範,採取「錯一字元即阻擋」的零容忍標準。

  • 📦
    build_index.py (索引編譯器)

    負責將分散的 Markdown 條目掃描、壓縮、萃取,並打包編譯成 RAG 系統所需的高效能 JSON 路由表。

  • 🛡️
    validate_index.py (極端防護測試)

    針對編譯後的樹狀結構執行 32 項對抗性防禦測試 (Adversarial Tests),包含防止「測試範本洩漏」與「孤兒節點 (Dangling paths)」檢查。

自動化工具與腳本控制台