01
Standard Test PASS ≠ Real Conversation Ready
- Problem
- Retrieval、Evidence Gate、Citation Validator 可以全部 PASS,但真實使用者唔會照測試句式問。
- What changed
- 加入 Human-style scenario UAT,專測自然語言、多輪改口、模糊 facts、跨部門情境。
- Reusable value
- Component test 保證工程正確;Human-style test 先會暴露真實使用問題。
02
Keyword Search ≠ Situation Understanding
- Problem
- 「咖啡、20 位、意粉、冇明火」可以 retrieve 到好多相關資料,但未必已經足夠判定 route。
- What changed
- 先拆 facts,再找會真正改變結果嘅 decisive fact;必要時只問一條 clarification。
- Reusable value
- 由「搵相似內容」升級成「理解個案再檢索」。
03
Exact Terms Must Stay Exact
- Problem
- 模型有時會將陌生字詞合理化,例如把相近食物名稱自動改成另一個有牌照意義嘅詞。
- What changed
- Interpreter 加 exact-term preservation;未經使用者確認唔自行更正具業務/法律意義嘅詞。
- Reusable value
- 對法規、牌照、醫療、合規系統都係基本安全要求。
04
New Facts Must Invalidate Old Assumptions
- Problem
- 多輪對話如果只累積 history,使用者改口後,舊 licence hypothesis 仍可能留低。
- What changed
- Latest explicit fact 更新 canonical facts,再 invalidate 受影響 derived state,重新 plan retrieval。
- Reusable value
- 真正 multi-turn reasoning 唔係「記住」,而係識得推翻自己之前嘅推論。
05
Department Scope ≠ KB Coverage
- Problem
- KB 暫時搵唔到某類資料,唔代表件事一定唔屬 FEHD。
- What changed
- 建立 authoritative service catalogue,將 department ownership 同 KB support status 分開。
- Reusable value
- 避免「資料未入庫」被誤判成「唔關本部門事」。
06
Official-sounding Hallucination Needs a Whitelist
- Problem
- LLM 最危險嘅錯誤之一係作一個聽落非常官方、其實不存在嘅牌照/許可證名稱。
- What changed
- 建立 canonical bilingual name、aliases、department、status whitelist;未核實 official-sounding name 要 block / rewrite。
- Reusable value
- 「名稱真唔真」同「個案適唔適用」必須分開驗證。
07
Human Escalation Is Architecture
- Problem
- 如果成功標準係「每題都要答到」,模型就會被推向過度自信同亂估。
- What changed
- 正式設計 KNOW → answer;not enough → ask;other department → refer;still unresolved → human。
- Reusable value
- 知道幾時停,係高風險 AI 系統嘅能力,唔係弱點。
08
Freeze Before Endless Polish
- Problem
- 如果 UAT 永遠一路改,就永遠冇固定版本畀真實使用者試,亦無法比較改善前後。
- What changed
- 建立 frozen release、Git tag、runtime hash、UAT / release separation、pilot logging。
- Reusable value
- Prototype 變產品,靠嘅唔只功能,仲有 version、rollback、audit 同 release discipline。
09 / EXECUTION DISCIPLINE
Debug 要有邊界,否則 AI Agent 可以永遠修落去。
項目後期一個重要工作方法係 bounded ticket:一次只處理一個 root cause,修完就驗證、交報告、停止。唔做「順手改埋」,亦唔因一條 non-critical edge case 即時重開 frozen release。
Small ticket → one root cause → tests → report → STOP.
實務上仲加入一條規則:同一個 issue 最多兩次 implementation attempts;如果再出現 policy / authority / architecture 不清,就由人決定,而唔係叫 Agent 再估。
10 / SIDE PRODUCTS
呢個 Project 額外產生咗幾套可以重用嘅模式。
Evidence-controlled RAG Pattern
Retrieve → Evidence Pack → Gate → Answer → Citation Validator
Conversation Resolution Pattern
Canonical Facts → Latest fact wins → Derived state invalidation → Re-plan
Policy Registry Pattern
將名稱、權限、邊界、clarification limit 等政策由 prompt 抽出,變成可測試、可版本化嘅 control layer。
Departmental AI Knowledge Management
最後證明真正可重用嘅唔只係 Licensing Chatbot,而係將 Knowledge、Policy、Conversation、Audit、Versioning 同 Human Escalation 組成一套部門級 AI Knowledge workflow。
SUMMARY
如果只記住六句。
- FAQ Retrieval 唔等於理解個案。
- LLM 可以理解,但關鍵決定要有 deterministic guardrail。
- 新 facts 必須推翻舊 assumptions。
- 官方名稱、部門權限、citation 都要有 backend control。
- 「唔知道」同「轉人工」係可靠系統嘅能力。
- 真正產品要有 freeze、version、rollback、logs。