企業 RAG 為什麼常答錯?換模型也救不了的三件事

企業 AI 落地研究所|Casper/Max|2026-10-08 建稿,預定 2026-10-11(週日)08:00–09:00(台北)錄製,集數待排。題目來自 LINE 群 10/4 Max 指定「地端 AI+RAG+ASR,包含設備」、10/3 Casper 地端 LLM 部署六原則、10/8 Muse 趨勢清單(RAG/Token/ROI)。依觀眾回饋,本集開場先給 hook,結尾給可帶走的 CTA。

資料與主張狀態見 選題卡與來源紀錄,完整口白見 對談稿。對應 backlog T-012。

本集問題與受眾

受眾:台灣企業主管、IT 負責人、正在評估「內部知識問答」或「地端 AI」的導入者。

要回答:公司的 AI 知識庫常常答錯,問題出在模型、資料,還是檢索?要先量什麼、管什麼,才決定要不要換模型或買設備?

主張:企業 RAG 答錯,多半是沒找到、找到舊的、或找到不該給你看的。這三個錯,換更大的模型都救不了。先用真實問題量命中率與引用正確率;權限在檢索當下用提問者身分過濾;新舊版本有生效日與作廢流程。地端設備決定跑不跑得動,檢索品質決定值不值得跑。

Hook(開場第一句,不超過 30 秒)

Casper: 同一個問題,業務問公司的 AI,拿到的是去年的報價;換一個人問,看到了他根本不該看的檔案。這兩個錯,換一個更強的模型都救不了。今天我們就來聊,企業的 AI 知識庫為什麼常常答錯。

節奏與預估時間

段落 主題 預算
0 Hook+開場、介紹 Max 2 分
1 RAG 是什麼?為什麼不把文件全丟給模型 4 分
2 天花板在檢索:三份測試怎麼說 5 分
3 怎麼量:命中率、引用正確率、會不會說不知道 5 分
4 權限:AI 用誰的身分去找資料 5 分
5 新舊版本:AI 拿到過期的 SOP 3 分
6 地端設備:Casper 六原則對到 RAG 6 分
7 ASR:會議錄音也是資料來源 3 分
8 Token 與 ROI:現在到底能省多少 4 分
9 收尾+CTA 2 分

全段預算約 39 分,含即興與追問。對談稿口白約 5,500 字,以每分鐘約 220~260 字照念約 22~25 分,加停頓、即興與【待 Max 補】段落估 30~36 分,未試念。若要壓在 30~34 分:第 5 段併入第 4 段(只留「撤權後還查得到嗎」一句),第 7 段只留 ASR 錯專有名詞的例子(各省 2 分);第 2 段只講 EnterpriseRAG-Bench 與 Kapa 兩份(省 1 分)。

0|Hook 與開場(2 分)

1|RAG 是什麼?為什麼不把文件全丟給模型(4 分)

2|天花板在檢索:三份測試怎麼說(5 分)

3|怎麼量:命中率、引用正確率、會不會說不知道(5 分)

4|權限:AI 用誰的身分去找資料(5 分)

5|新舊版本:AI 拿到過期的 SOP(3 分)

6|地端設備:Casper 六原則對到 RAG(6 分)

7|ASR:會議錄音也是資料來源(3 分)

8|Token 與 ROI:現在到底能省多少(4 分)

9|收尾與 CTA(2 分)

來源與待核對事項

主要來源(詳見來源紀錄): - EnterpriseRAG-Bench(Onyx,2026-05,Draft) - Kapa Company Knowledge Bench(2026-10-02,廠商自測) - LayerRAG-Bench(2026-07,單一作者預印本) - VentureBeat:Azure OpenAI agent passed every evaluation, served files user couldn't open(約 2026-09-01) - AWS:Rethinking access control for RAG(2026-10-07) - OWASP RAG Security Cheat Sheet - Open WebUI RBAC、Open WebUI v0.11.4(2026-09-21)、RAGFlow v1.0.0-rc1(2026-09-29) - 數位時代:企業建立知識庫前先想清楚這6件事(2026-09-29,叡揚合作企劃) - Breeze-ASR-26(聯發科研究+陽明交大) - Cloudflare AI Search GA(2026-10-01)

待核對,不口播:EnterpriseRAG-Bench 排行榜當日分數;Kapa 文中轉述的 Cursor/Jev 說法;Cioffi 案「約六成郵件自動處理」;Open WebUI 是否能繼承原系統逐檔權限。

待 Max 補:自己的地端架構;COMMEET/Ankey 可公開實例;CTA 題數;「地端 RAG 瓶頸偏 prefill/KV Cache」是否同意。

麥克風可以說/不要說

可以說

  1. 「Onyx 做的 EnterpriseRAG-Bench,模擬一家公司五十多萬份文件,關鍵字檢索答對大約七成、向量檢索大約五成;文件越多,越難找到。Onyx 自己也賣 RAG 產品。」
  2. 「Kapa 十月初公布的測試,一千題真實企業問題,最好的檢索也只到 0.65;加一個重排序,就從 0.41 拉到 0.50。這是他們自己的產品、自己的資料。」
  3. 「有一份預印本測了九個模型:索引過期、權限被擋、拿到別人 session 的資料,九個模型全部答不出正確答案。換模型救不了。」
  4. 「VentureBeat 報導一個自建的 Azure OpenAI 助理,評測全過,但低權限帳號拿到了自己打不開的 SharePoint 內容;原因是用建索引那個帳號的權限去找資料。」

不要說

  1. 不要說「研究證明 RAG 準確率只有六成」——三份測試資料、題型、評分方式都不同,也都不是你的公司。
  2. 不要說「Azure 有漏洞」或「Copilot 外洩別人的信」——前者是自建流程繞過原生權限修剪,後者 Microsoft 稱沒有讓人看到無權限內容。
  3. 不要說「地端比較省」、不要報設備價格與回本年限。
  4. 不要說 Breeze-ASR-26 是國語模型或已達商用等級。
  5. 不要替 Max 說「我們客戶的命中率從幾成拉到幾成」,除非 Max 錄前提供。