從單模態到多模態
以前我們對 LLM 的理解是:文字進、文字出。你打一段文字,它回一段文字。所以 RAG 也是:搜到文字、塞進 prompt、產出文字。這是單模態的思維。
但現在的模型已經不只是這樣了。它可以接受文字、圖片、聲音作為輸入,也可以產出文字和圖片。這代表 RAG 的「R」不再只是搜文字,「G」也不再只是生文字。
以前:單模態
- 輸入 — 只有文字
- 處理 — 文字變形、重組、摘要
- 輸出 — 只有文字
- RAG — 搜文字 → 塞 prompt → 生文字
現在:多模態
- 輸入 — 文字、圖片、聲音、PDF、影片
- 處理 — 任意模態互相理解、轉換
- 輸出 — 文字、圖片、結構化資料
- RAG — 搜任何東西 → 產出任何東西
Transformer 的本質:任意轉任意
Transformer 架構的核心能力就是把任意東西「翻譯」成任意東西。它原本是為了語言翻譯設計的(英文 → 中文),但這個架構的威力遠不止於此:
- 論文 PDF → 結構化摘要
- 醫學影像 → 診斷報告
- 一段語音 → 會議紀錄
- 查詢結果 → 簡報 PPT
- 幾行範例 code → 完整的應用程式
這不是未來式,這是現在就能做到的事。今天課堂上的讀論文、讀圖片程式,就是多模態的實際應用。
Agentic RAG:從固定到動態
傳統 RAG 是固定的:你上傳一個 PDF,它讀完回答你,僅此而已。
Agentic RAG 是動態的:AI 自己決定要去哪裡搜、搜什麼、搜幾次。搜到的結果不夠好?它會換個方式再搜。需要更多資訊?它會主動去找。
固定輸入 → 固定輸出
上傳一篇 PDF → 產出一段摘要
傳統 RAG
動態搜尋 → 動態結果
問一個問題 → Agent 自動搜尋多個來源 → 整合出完整答案
Agentic RAG
複雜輸入 → 複雜輸出
輸入複雜的查詢結果 → 產出一份簡報 PPT
多模態 Agentic RAG
少量範例就能產出驚人結果
隨著模型越來越強,你不需要餵它海量資料。有時候只要給幾個範例 code、幾筆搜尋結果,它就能推理出完整的解決方案。
這改變了我們做 RAG 的思路:不再是「越多資料越好」,而是「給對的資料就好」。一段精準的搜尋結果,比一整個資料庫的 dump 更有用。
這也是為什麼今天的實作只用單檔程式就能做出有用的工具——模型本身的理解力已經夠強,你只需要把正確的東西餵給它。
練習作業:用 Claude Code 把論文變成簡報
這個練習讓你體驗多模態 RAG 的完整流程:輸入一篇 PDF 論文,讓 AI 理解內容後,產出一份結構完整的 PPTX 簡報。
這就是 Transformer「任意轉任意」的威力——PDF 進、PPTX 出,中間不需要你手動整理任何東西。
操作步驟
Step 1:下載論文
下載這篇論文:Voyager: An Open-Ended Embodied Agent with Large Language Models(arXiv: 2305.16291)。這篇論文展示如何用 LLM 打造能在 Minecraft 中自主探索、學習新技能的 AI Agent,跟我們課程主題高度相關。
Step 2:打開 Claude Code
# 在論文所在的目錄打開 Claude Code
$cd ~/Downloads
$claude
Step 3:給 Claude Code 指令
# 在 Claude Code 裡輸入:
讀這篇論文 2305.16291v2.pdf,
幫我做一份 PPTX 簡報。
要求:
- 10-15 頁
- 包含:研究背景、方法、主要發現、結論
- 每頁要有重點條列
- 加上適當的標題
Step 4:檢查並調整
Claude Code 會自動讀取 PDF、理解內容、產生 Python 腳本來建立 PPTX。如果結果不滿意,直接跟它說要修改什麼,例如「多加一頁講實驗設計的細節」或「把結論那頁的重點再精簡一點」。
這個練習練到什麼?
-
多模態輸入
Claude Code 能直接讀取 PDF,包含文字、圖表、公式——這就是多模態的「輸入」端
-
多模態輸出
產出的不是純文字,而是一份結構化的 PPTX 檔案——這就是多模態的「輸出」端
-
Agentic 工作流
Claude Code 會自己決定怎麼拆解論文、怎麼組織簡報結構、需要裝什麼套件(如 python-pptx)——這就是 Agent 的自主決策能力
-
迭代式 Prompt
第一次產出不完美?直接跟 Claude Code 說要改什麼。這種對話式的迭代,比手動改 code 快十倍
重點:你不需要會寫 python-pptx 的程式碼。你只需要用自然語言描述你要什麼,Claude Code 會幫你搞定所有技術細節。這就是 AI Agent 時代的工作方式。
繳交內容
- 1. 產出的 PPTX 簡報檔案
- 2. 你使用的論文 PDF(或論文連結)
- 3. 你給 Claude Code 的 prompt 截圖(至少一張)