企業資料清理:RAG 系統成敗的關鍵環節
在企業導入私有 AI 應用的浪潮中,大家都在談 RAG(Retrieval-Augmented Generation)技術有多強大,但很少人討論一個更本質的問題: 你的資料夠乾淨嗎?
在我實際參與營造產業的 AI 應用過程中,我觀察到一個關鍵問題:營造業的技術資料很多都是投影片轉存的 PDF,這類資料的知識結構和完整性都很差,連帶就會影響後續 RAG 的資料取用,最終影響 AI 回答的正確性。
這個現象點出了企業 AI 應用中最容易被忽略,卻可能最致命的問題。
🎯 問題的本質:Garbage In, Garbage Out
核心事實
資料品質不是 RAG 系統的附加價值,而是決定系統能否正常運作的基礎設施。根據 2024 年的業界研究,低品質資料造成的 AI 系統失敗案例中,超過 70% 的問題可以追溯到資料前處理階段。
知識結構的破碎化
投影片本質上就是「精簡版」資訊,設計目的是輔助口頭報告,而非完整記錄知識。當這些投影片轉存為 PDF 後,問題會進一步惡化:
❌ 投影片的侷限
- 僅保留關鍵字與要點
- 缺乏完整的上下文說明
- 圖表與文字脫節
- 依賴口頭補充說明
✅ RAG 需要的資料
- 完整的語句和段落
- 清晰的邏輯結構
- 圖文的關聯性
- 獨立可理解的內容
營造產業的特殊挑戰
以營造產業為例,這個問題特別嚴重:
格式混亂 :
- 掃描版 PDF(圖片形式)需要 OCR,辨識錯誤率高
- 排版格式不統一,影響文本解析
- 專業術語、編號系統(如 CNS 規範編號)容易被錯誤切割
知識完整性不足 :
- 缺少施工背景、適用條件、注意事項等關鍵資訊
- 「為什麼這樣做」的推理過程往往被省略
- 僅有結論性的要點,沒有支持性的細節
多模態資訊斷裂 :
- 施工照片與文字說明的關聯性難以保留
- 工程圖說與施工步驟脫節
- 規範標準的引用關係破碎
🔗 對 RAG 系統的連鎖影響
資料品質問題會在 RAG 系統的每個環節被放大,形成惡性循環。
階段一:Embedding 失真
當文本品質低落時,向量嵌入(Embedding)就會產生低品質的語義表示:
破碎的文本 → 低品質向量 → 語義相似度計算失準 → 檢索失效實際案例 :
假設有一段施工規範原本是:
「混凝土澆置前,應確保模板支撐系統穩固,鋼筋綁紮符合設計圖說,並完成預埋件安裝。環境溫度低於 5°C 時,應採取保溫措施。」
但投影片轉存後變成:
「澆置前檢查
- 模板系統
- 鋼筋
- 預埋件 (溫度 <5°C → 保溫)」
第二種形式的 Embedding 品質會明顯較差,因為:
- 失去了完整的語句結構
- 遺失了「為什麼」的因果關係
- 溫度條件的說明被簡化為符號
階段二:檢索錯誤
當用戶問「混凝土澆置時遇到低溫天氣該怎麼辦?」
低品質資料的檢索結果 :
- 可能檢索到「模板系統」相關內容(因為在同一頁)
- 可能完全遺漏「保溫措施」(因為被簡化為符號)
- Top-K 結果充斥無關片段
高品質資料的檢索結果 :
- 直接命中「環境溫度低於 5°C」條件
- 完整提供「應採取保溫措施」的建議
- 同時包含相關的背景說明
階段三:生成偏差
LLM 基於不完整的 Context 進行推理,後果嚴重:
⚠️ 幻覺問題加劇
當 AI 無法從檢索結果中找到完整資訊時,會更容易「編造」看似合理但實際錯誤的答案。
範例 :可能回答「低溫時應加快澆置速度」(錯誤),而非「採取保溫措施」(正確)。
💡 實務解決方案
面對資料品質問題,我們需要短期與中長期並行的策略。
短期策略:快速改善
1. 資料分級處理
不是所有文件都需要完美,建立優先順序:
🟢 Tier 1
高品質文件
完整的技術規範、標準文件
→ 優先建立索引
🟡 Tier 2
中品質文件
投影片轉存的 PDF
→ 人工審核 + 補充
⚪ Tier 3
低品質文件
掃描文件、手寫筆記
→ 先存檔,後處理
2. Metadata 增強
為每份文件加上結構化的 Metadata:
{ "document_type": "施工規範", "completeness_level": "完整", "source_context": { "original_format": "PowerPoint", "presenter": "王工程師", "presentation_date": "2024-03-15", "topic": "混凝土施工品質管制" }, "quality_score": 0.65, "requires_enhancement": true}這些 Metadata 可以幫助 RAG 系統:
- 優先使用高完整度的文件
- 在回答時標註資訊來源的可靠度
- 自動觸發人工審核流程
3. Chunk 策略優化
針對投影片類文件,使用「 頁面級 Chunk 」而非固定長度切割:
❌ 固定長度切割
可能在句子中間切斷,破壞語義完整性。特別是投影片,可能把標題和內容分開。
✅ 頁面級 Chunk
保留頁面內的所有元素(標題 + 內容 + 圖說),在 Metadata 中記錄前後頁面關聯。
中長期策略:系統性改善
1. 建立知識重構流程
不要期待原始資料完美,建立一套改善流程:
關鍵環節 :
- 自動評分 :基於文本完整度、結構清晰度、引用可驗證性
- 人工審核 :專家補充「為什麼」的推理過程、適用條件、注意事項
- 版本控管 :保留改善歷史,持續優化
2. 多模態 RAG 架構
營造業的資料往往需要「文字 + 圖表 + 施工照片」的多模態整合:
技術方案 :
- 使用 CLIP 等模型處理圖表和照片
- 建立「文字-圖像」的關聯索引
- 檢索時同時返回文字說明和相關圖像
- LLM 能夠理解並整合多模態資訊
實際效益 : 當用戶問「鋼筋綁紮的正確方式」時,系統能同時提供:
- 📄 文字說明(步驟、規範、注意事項)
- 📷 施工照片(正確示範)
- 📊 工程圖說(細部節點)
3. 主動式知識管理
讓 AI 系統參與資料品質改善:
💡 智慧反饋機制
- AI 發現知識片段不完整時,自動標記為「待補充」
- 追蹤「高頻但低滿意度」的查詢,優先改善相關文件
- 建立專家審核機制,定期補充關鍵資訊
- 監控生成品質,反向優化資料處理流程
4. 採用 Document Intelligence
現代化的文件解析工具能大幅提升處理品質:
| 工具類型 | 代表產品 | 核心能力 | 適用場景 |
|---|---|---|---|
| 開源解決方案 | Docling (IBM)、Unstructured.io | 保留文件結構的高品質轉換 | 預算有限、需要客製化 |
| 雲端服務 | Azure Document Intelligence、AWS Textract | 強大的 OCR 與版面分析 | 大規模處理、需要高準確度 |
| 專業解析 | LlamaParse (LlamaIndex) | 針對 RAG 優化的解析 | RAG 系統專用 |
選擇建議 :
- 預算充足 + 資料敏感度低 → Azure/AWS 雲端服務
- 預算有限 + 需要掌控度 → Docling/Unstructured.io
- 已使用 LlamaIndex → LlamaParse(最佳整合)
🎯 80/20 法則:實務建議
根據我的經驗和業界實踐,面對龐大的歷史資料,「完美主義」往往是失敗的開始。
識別 20% 的核心文件
🎯 高價值文件識別標準
📈 使用頻率
被查詢次數 Top 20% 的主題
⚠️ 風險等級
涉及安全、品質、法規的內容
🔄 更新頻率
規範標準、常用工法
💡 知識密度
包含核心技術與關鍵判斷
行動方案 :
- 第 1 個月 :識別並清理 20% 核心文件
- 第 2-3 個月 :建立高品質的「黃金資料集」並上線測試
- 第 4 個月起 :根據使用反饋,逐步擴充資料集
其餘 80% 的文件:接受不完美
對於剩餘的文件:
- ✅ 使用自動化工具做初步處理
- ✅ 透過使用反饋逐步改善(而非事前完美)
- ✅ 在回答時標註資訊來源的可靠度
- ✅ 建立「待改善文件清單」,依優先順序處理
建立持續改善循環
部署 70 分系統 → 收集使用反饋 → 識別問題資料 → 優先改善 → 重新部署 90 分系統關鍵指標 :
- 問答準確率(目標:從 70% 提升至 90%)
- 資料涵蓋率(目標:核心主題 100% 覆蓋)
- 用戶滿意度(目標:「有幫助」比例 > 85%)
- 幻覺率(目標:< 5%)
💡 核心理念
完美是優秀的敵人。 不要等資料 100% 清理完才上線,而是先上線一個「70 分的系統」,然後透過實際使用快速迭代到 90 分。
📊 成功案例參考
根據 2024 年業界研究報告,採用系統化資料清理策略的企業 RAG 系統:
| 改善項目 | 改善前 | 改善後 | 提升幅度 |
|---|---|---|---|
| 問答準確率 | 62% | 89% | +43% |
| 首次檢索命中率 | 45% | 78% | +73% |
| 幻覺問題發生率 | 18% | 4% | -78% |
| 用戶滿意度 | 3.2/5 | 4.5/5 | +41% |
資料來源:IBM Research (2024), "The Cost of Poor Data Quality in Enterprise AI"
結語
企業資料清理不是一個「做完就好」的專案,而是一個需要持續經營的系統工程。
在這個過程中,最重要的不是追求完美,而是:
- 正視問題 :承認現有資料的品質問題
- 分級處理 :先解決 20% 的核心問題
- 持續改善 :透過使用反饋不斷優化
- 技術賦能 :善用現代化工具提升效率
當營造業的工程師能夠問 AI「混凝土低溫施工的注意事項」,並得到準確、完整且可信賴的回答時,那才是企業 AI 應用真正落地的時刻。
而這一切,都始於對資料品質的重視。
資料來源
外部資料
The Rise and Evolution of RAG in 2024: A Year in Review - RAGFlow
- RAG 技術在 2024 年的發展趨勢,強調資料清理的重要性
Why Data Quality Makes or Breaks Your Enterprise RAG System - Nstarx Inc
- 企業 RAG 系統中資料品質的關鍵影響,引用 IBM Research 2024 研究
Essential Data Preprocessing for Any RAG System - Unstructured.io
- RAG 系統的資料前處理最佳實踐
Taming the Enterprise Data Beast: Making Your Data RAG-Ready - LinkedIn
- 企業資料清理與預處理的實務建議
Best Practices for RAG Pipelines - Medium
- RAG 流程的最佳實踐與 Chunking 策略
本地知識庫
- 個人在企業 AI 應用領域的實務經驗