企業 RAG 為什麼常答錯?換模型也救不了的三件事
企業 AI 落地研究所|Casper/Max|2026-10-08 建稿,預定 2026-10-11(週日)08:00–09:00(台北)錄製,集數待排。題目來自 LINE 群 10/4 Max 指定「地端 AI+RAG+ASR,包含設備」、10/3 Casper 地端 LLM 部署六原則、10/8 Muse 趨勢清單(RAG/Token/ROI)。依觀眾回饋,本集開場先給 hook,結尾給可帶走的 CTA。
資料與主張狀態見 選題卡與來源紀錄,完整口白見 對談稿。對應 backlog T-012。
本集問題與受眾
受眾:台灣企業主管、IT 負責人、正在評估「內部知識問答」或「地端 AI」的導入者。
要回答:公司的 AI 知識庫常常答錯,問題出在模型、資料,還是檢索?要先量什麼、管什麼,才決定要不要換模型或買設備?
主張:企業 RAG 答錯,多半是沒找到、找到舊的、或找到不該給你看的。這三個錯,換更大的模型都救不了。先用真實問題量命中率與引用正確率;權限在檢索當下用提問者身分過濾;新舊版本有生效日與作廢流程。地端設備決定跑不跑得動,檢索品質決定值不值得跑。
Hook(開場第一句,不超過 30 秒)
Casper: 同一個問題,業務問公司的 AI,拿到的是去年的報價;換一個人問,看到了他根本不該看的檔案。這兩個錯,換一個更強的模型都救不了。今天我們就來聊,企業的 AI 知識庫為什麼常常答錯。
- 錄製備註:hook 先講情境,再講「歡迎來到企業 AI 落地研究所」。兩個情境都是假設,不要說成某家公司的真實事件。真實案例(VentureBeat)放第 4 段。
節奏與預估時間
| 段落 | 主題 | 預算 |
|---|---|---|
| 0 | Hook+開場、介紹 Max | 2 分 |
| 1 | RAG 是什麼?為什麼不把文件全丟給模型 | 4 分 |
| 2 | 天花板在檢索:三份測試怎麼說 | 5 分 |
| 3 | 怎麼量:命中率、引用正確率、會不會說不知道 | 5 分 |
| 4 | 權限:AI 用誰的身分去找資料 | 5 分 |
| 5 | 新舊版本:AI 拿到過期的 SOP | 3 分 |
| 6 | 地端設備:Casper 六原則對到 RAG | 6 分 |
| 7 | ASR:會議錄音也是資料來源 | 3 分 |
| 8 | Token 與 ROI:現在到底能省多少 | 4 分 |
| 9 | 收尾+CTA | 2 分 |
全段預算約 39 分,含即興與追問。對談稿口白約 5,500 字,以每分鐘約 220~260 字照念約 22~25 分,加停頓、即興與【待 Max 補】段落估 30~36 分,未試念。若要壓在 30~34 分:第 5 段併入第 4 段(只留「撤權後還查得到嗎」一句),第 7 段只留 ASR 錯專有名詞的例子(各省 2 分);第 2 段只講 EnterpriseRAG-Bench 與 Kapa 兩份(省 1 分)。
0|Hook 與開場(2 分)
- 主問題:(Casper 講完 hook)今天很開心一樣邀請到 Max,從工程實務的角度帶我們拆解企業 RAG。Max,你最常聽到企業說 AI 知識庫哪裡不好用?
- 可接的追問:大家第一個反應是不是換模型?
- 這段要說清楚:三種錯——找不到、找到舊的、找到不該看的。後面每段都回到這三種錯。
- 錄製備註:Max 的回答若要舉 COMMEET/Ankey 實例,待 Max 補;未補前用假設情境(報帳規則)。
1|RAG 是什麼?為什麼不把文件全丟給模型(4 分)
- 主問題:先幫第一次聽到的觀眾解釋,RAG 是什麼?
- 可接的追問:
- 那為什麼不把公司所有文件直接丟給模型就好?現在模型不是可以讀很長嗎?
- 跟我們平常在 NotebookLM 上傳文件問問題,是一樣的東西嗎?
- 這段要說清楚:RAG(Retrieval-Augmented Generation,檢索增強生成)=先從公司資料找出相關段落,再讓模型根據這些段落回答。比喻:開書考試,先翻到對的那一頁,才寫得出對的答案。全丟的問題:上下文有長度上限、每次都要付 Token、權限沒辦法分人。
- 案例與來源:數位時代 2026-09-29(叡揚合作企劃)作者自述:把財務部報帳規則丟進 NotebookLM 仍答錯,因為標色邏輯只有財務部看得懂——文件寫給人看,不一定寫給 AI 看。自架模型的上下文通常比雲端小(Patrick McCanna 2026-09-13,單人單機體驗,不外推)。
- 錄製備註:叡揚是合作企劃,口播說「數位時代一篇文章裡作者提到」。不念 65k、14% 這類單機數字。
2|天花板在檢索:三份測試怎麼說(5 分)
- 主問題:為什麼你說企業 RAG 的天花板不在模型,在檢索?
- 可接的追問:
- 有數據嗎?還是工程師的直覺?
- 那向量資料庫不是大家都在講的標配嗎?
- 如果模型越來越強,這個問題會不會自己消失?
- 這段要說清楚:
- EnterpriseRAG-Bench(Onyx,2026-05):模擬一家公司約 51 萬份文件(Slack、Email、Jira、Confluence、會議逐字稿),刻意放入錯置、近似重複、互相矛盾的資料。基線結果:關鍵字檢索(BM25)答對率約七成,向量檢索約五成;文件越多,命中率越低。
- Kapa(2026-10-02):1,000 題真實企業查詢,最好也只到 0.65;加一個重排序(reranker)就從 0.41 到 0.50,比換模型便宜。
- LayerRAG-Bench(2026-07):索引過期、權限被拒、拿到別人 session 的資料,九個模型成功率全部是 0。
- 要接住的答案:模型會變強,但「沒被找出來的文件」「已經過期的文件」「你沒權限的文件」,模型再強也不會知道。
- 錄製備註:每個數字都要說誰測的。Onyx、Kapa 都賣 RAG 產品;LayerRAG 是單一作者預印本、合成資料。只說「這幾份測試都指向同一件事」,不說「研究證明所有企業都這樣」。排行榜分數(OpenClaw 68.2 等)口播前回 leaderboard 查當日,否則不念。
3|怎麼量:命中率、引用正確率、會不會說不知道(5 分)
- 主問題:如果我是 IT 主管,明天要驗收一套 AI 知識庫,要量什麼?
- 可接的追問:
- 題目從哪裡來?請廠商出題可以嗎?
- 要多少題才夠?
- 「答對」誰來判斷?
- 這段要說清楚:
- 題目要來自員工真的問過的問題,每題先標好正確答案在哪份文件、哪一版。廠商出的題目容易剛好都答得出來。
- 再來是三個數字:命中率(該找的文件有沒有被找出來)、引用正確率(附上的出處真的支持答案嗎)、拒答(資料不夠時會不會說不知道)。
- 題目固定下來,之後換模型、換切塊方式、加 reranker,都用同一批題目重跑。
- 案例與來源:iT 邦幫忙社群文(Day 22)列的 PoC 指標表可當參考(Recall@K、引用正確率、拒答率、越權測試、P95 延遲);EnterpriseRAG-Bench 專門有「資料庫裡沒有答案」的題型。
- 錄製備註:題數本稿暫寫「建議 50 題」,待 Max 定;說明是起步建議,不是研究門檻。
4|權限:AI 用誰的身分去找資料(5 分)
- 主問題:剛才 hook 講到「看到不該看的檔案」,這種事真的會發生嗎?
- 可接的追問:
- 不是在 prompt 裡寫「不要給沒權限的人看」就好了嗎?
- 那我用的是 Open WebUI 這種開源介面,權限怎麼做?
- 員工離職或調部門,AI 什麼時候才知道?
- 這段要說清楚:
- VentureBeat(約 2026-09-01):義大利一家微軟合作夥伴自建 Azure OpenAI 郵件助理,評測全過;用低權限帳號問同樣問題,卻拿到該帳號在 SharePoint 打不開的內容。原因是檢索用的是「建索引那個帳號」的權限。修法:查詢當下用提問者的權限先過濾,再交給模型。
- 原則(OWASP RAG Security Cheat Sheet):權限要跟著每一段切塊走、檢索當下檢查、查不到權限就回空,不能先給模型看再叫它保密。
- AWS(2026-10-07)也把「定期同步權限」改成查詢當下回原系統核對,理由是同步之間撤權會有空窗。
- 開源工具:Open WebUI 的知識庫用群組分享讀寫權限;RAGFlow 1.0 預覽版自己寫了「Team/Me 權限模型還沒支援」。選工具時要問清楚權限單位是「整個知識庫」還是「每一份文件」。
- 帶走的測試:同一批題目,用高權限、低權限兩個帳號各跑一次。
- 錄製備註:VentureBeat 案不要說成「Azure 的漏洞」——是自建流程繞過了原生的權限修剪。The Register 2026-02 Copilot 標籤案,Microsoft 稱沒有讓人看到無權限內容,不要拿來當跨人外洩的例子。Open WebUI 能否自動繼承原系統逐檔權限,待 Max 依經驗確認。
5|新舊版本:AI 拿到過期的 SOP(3 分)
- 主問題:除了權限,hook 裡另一個錯是拿到去年的報價。這要怎麼防?
- 可接的追問:檔案更新了,AI 不是會自己知道嗎?刪掉的檔案,AI 還找得到嗎?
- 這段要說清楚:新舊版本同時被找出來是最常見的情況。文件要有生效日、作廢狀態;來源刪除要連動刪掉切塊、向量與快取。檢索時優先現行版本,有衝突就標出來。
- 案例與來源:EnterpriseRAG-Bench 有「資料互相矛盾」題型;LayerRAG 的索引過期情境裡,答案看起來有引用卻是舊的;Open WebUI v0.11.4(2026-09-21)讓檔案 metadata 跟著切塊帶到引用來源,可放版本與日期。
- 錄製備註:時間不夠時併入第 4 段,只留「撤權、刪檔後還查得到嗎」一句。
6|地端設備:Casper 六原則對到 RAG(6 分)
- 主問題(Casper 先講):我上週在群組整理了地端 LLM 部署六個原則:記憶體容量、記憶體頻寬、算力、軟體堆疊、模型架構、服務併發。Max,這跟你的地端架構對得上嗎?做 RAG 的話,哪幾個最要緊?
- 可接的追問:
- RAG 跟一般聊天比,對設備的要求哪裡不一樣?
- MoE 模型,總參數決定裝不裝得下,啟用參數決定每個 token 算多少——這對企業選型有什麼意義?
- 中小企業一台 Mac Studio 或 DGX Spark 夠嗎?
- 這段要說清楚:
- 六原則(Casper 自己說):Memory Capacity(模型尺寸、量化、上下文、KV Cache 裝不裝得下)、Memory Bandwidth(每秒產生幾個 token)、Compute(prefill、批次、多模態)、Software Stack(CUDA/Metal、vLLM/TensorRT-LLM)、Model Architecture(Dense/MoE、注意力、FP4)、Serving Concurrency(吞吐、KV Cache、SLA)。
- Max 對應到 RAG(推論,待 Max 確認或改說法):RAG 每一題都塞進大量檢索內容,長輸入的處理(prefill)跟多人同時用的 KV Cache 先吃緊;除了大模型,還要跑 embedding 與 reranker,常被忘記算進去。
- 整套不只一個模型:介面(例如 Open WebUI)+推論引擎(Ollama/vLLM)+向量或全文索引+embedding/reranker+(第 7 段)ASR。
- Max 的架構:待 Max 補(回應 Casper 10/3 的提問:模型、推論引擎、介面、索引、ASR)。
- 錄製備註:Casper 實驗室設備(RTX 5090、Mac Studio、DGX Spark、採購中 PRO 6000)由 Casper 本人決定是否口播。不報價、不排名、不講回本年限(頻道主張:地端不能用省錢立論,見 T-001)。不念 tokens/s。
7|ASR:會議錄音也是資料來源(3 分)
- 主問題:Max 在群組裡把 ASR 也放進這次主題。語音辨識跟 RAG 有什麼關係?
- 可接的追問:台灣開會國台英夾雜,辨識得出來嗎?錄音誰能查?
- 這段要說清楚:很多決策只存在會議裡。錄音先轉文字(ASR),才進得了知識庫;轉錯一個產品代號或客戶名,後面檢索就找不到。會議逐字稿的權限要跟「誰參加了這場會」走。
- 案例與來源:EnterpriseRAG-Bench 把會議逐字稿列為九種企業資料之一,而且是平均最長的一種。台灣在地開源:聯發科研究與陽明交大的 Breeze ASR 25(台灣華語)、Breeze-ASR-26(台語轉華語字幕,Apache-2.0)。
- 錄製備註:Breeze-ASR-26 是台語模型,訓練資料為合成語音;CER 數字只在 30 段官方宣導音檔上測,不念數字、不說「商用等級」。錄音的告知與同意是另一個題目,帶一句即可。
8|Token 與 ROI:現在到底能省多少(4 分)
- 主問題:Muse 那份趨勢清單有一題「談 Token 夠直接,但現在能省多少?」——RAG 的帳單到底花在哪?
- 可接的追問:
- 地端不就不用付 Token 了嗎?
- 老闆問 ROI,要怎麼算才不會被打槍?
- 這段要說清楚:
- 帳單大頭常是「檢索塞進去的內容」,不是使用者那一句問題。Kapa 的測試裡,只靠 grep 的 Agent 每題回傳約 4 萬 tokens,精簡的檢索約 5 千 tokens(Kapa 自測、廠商立場)。
- 「單價最便宜不等於每個任務最便宜」:重試、塞太多內容、人工收拾,都算進成本(round3 引 CloudZero)。
- ROI 的分母要用「答對而且附正確出處的題數」,對照員工自己找資料的時間;不要用「省下幾個人」這種 ROI 百分比(T-004 那把尺)。
- 地端不用付 API Token,但有設備、電、維運人力;不用省錢當理由,用資料不能外送、用量穩定來談(T-001、T-002)。
- 錄製備註:COMMEET/Ankey 若有可公開的 before/after,待 Max 補;沒有就不舉數字。Cloudflare AI Search 公開價(語意查詢 $0.75/千次)可當「買現成服務」的參考,但標明 11/1 起計費、供應商自述。
9|收尾與 CTA(2 分)
- Casper 整理(只講本集談過的):三種錯——找不到、找到舊的、找到不該看的;先量再換模型;權限在檢索當下過濾;地端設備看六原則,但先確定檢索值得跑。
- 帶走動作:
- 本週挑一個部門,收集員工真的問過的問題(建議 50 題),標好正確答案在哪份文件、哪一版。
- 量三件事:找到了沒、引用對不對、資料不夠會不會說不知道。
- 同一批題目,用高、低權限兩個帳號各跑一次。
- 量完再決定:換模型、加 reranker、整理文件,還是買設備。
- CTA 口白:如果你是企業主、主管或 IT 負責人,歡迎訂閱企業 AI 落地研究所;也歡迎在留言區告訴我們,你公司的 AI 最常答錯哪一類問題,我們挑幾題下一集拆解。
- 錄製備註:「挑幾題下一集拆解」需 Casper 確認願意承諾,否則改成「我們會整理大家的留言」。
來源與待核對事項
主要來源(詳見來源紀錄): - EnterpriseRAG-Bench(Onyx,2026-05,Draft) - Kapa Company Knowledge Bench(2026-10-02,廠商自測) - LayerRAG-Bench(2026-07,單一作者預印本) - VentureBeat:Azure OpenAI agent passed every evaluation, served files user couldn't open(約 2026-09-01) - AWS:Rethinking access control for RAG(2026-10-07) - OWASP RAG Security Cheat Sheet - Open WebUI RBAC、Open WebUI v0.11.4(2026-09-21)、RAGFlow v1.0.0-rc1(2026-09-29) - 數位時代:企業建立知識庫前先想清楚這6件事(2026-09-29,叡揚合作企劃) - Breeze-ASR-26(聯發科研究+陽明交大) - Cloudflare AI Search GA(2026-10-01)
待核對,不口播:EnterpriseRAG-Bench 排行榜當日分數;Kapa 文中轉述的 Cursor/Jev 說法;Cioffi 案「約六成郵件自動處理」;Open WebUI 是否能繼承原系統逐檔權限。
待 Max 補:自己的地端架構;COMMEET/Ankey 可公開實例;CTA 題數;「地端 RAG 瓶頸偏 prefill/KV Cache」是否同意。
麥克風可以說/不要說
可以說
- 「Onyx 做的 EnterpriseRAG-Bench,模擬一家公司五十多萬份文件,關鍵字檢索答對大約七成、向量檢索大約五成;文件越多,越難找到。Onyx 自己也賣 RAG 產品。」
- 「Kapa 十月初公布的測試,一千題真實企業問題,最好的檢索也只到 0.65;加一個重排序,就從 0.41 拉到 0.50。這是他們自己的產品、自己的資料。」
- 「有一份預印本測了九個模型:索引過期、權限被擋、拿到別人 session 的資料,九個模型全部答不出正確答案。換模型救不了。」
- 「VentureBeat 報導一個自建的 Azure OpenAI 助理,評測全過,但低權限帳號拿到了自己打不開的 SharePoint 內容;原因是用建索引那個帳號的權限去找資料。」
不要說
- 不要說「研究證明 RAG 準確率只有六成」——三份測試資料、題型、評分方式都不同,也都不是你的公司。
- 不要說「Azure 有漏洞」或「Copilot 外洩別人的信」——前者是自建流程繞過原生權限修剪,後者 Microsoft 稱沒有讓人看到無權限內容。
- 不要說「地端比較省」、不要報設備價格與回本年限。
- 不要說 Breeze-ASR-26 是國語模型或已達商用等級。
- 不要替 Max 說「我們客戶的命中率從幾成拉到幾成」,除非 Max 錄前提供。