
TAIDE:國科會打造的正體中文 LLM
· #TAIDE #LLM #繁體中文 #AI #國科會 #技術隨筆
TAIDE(Trustworthy AI Dialogue Engine,可信任生成式 AI 對話引擎,民間常稱「臺版 ChatGPT」)是近年很受關注的台灣本土模型。本文整理它的背景、版本、能力與定位。
它是什麼
由**國科會(NSTC)**指導、國家實驗研究院(NARLabs/NIAR)執行,2023 年 4 月啟動。目標是做出符合台灣語言與文化特性、又「可信任」的正體中文大語言模型——減少對外國技術依賴、保護本國文化。
背景動機:國際大模型多數訓練資料是英文、中文偏簡體,回應常與台灣文化與價值觀脫節。TAIDE 就是用來補上這個缺口。
模型演進(一路換基底)
| 版本 | 時間 | 基底 | 重點 |
|---|---|---|---|
| TAIDE LX-7B/LX-13B | 2024/04 | Llama 2 | 首發正式版(7B 可商用、13B 學研用) |
| Llama3-TAIDE-LX-8B-Chat-Alpha1 | 2024/04 | Llama 3 | 搶先版(Meta 釋出後 4 天就做好) |
| Llama 3.1-TAIDE-LX-8B-Chat | 2025/02 | Llama 3.1 | context 拉到 131K、繁中解碼快 20% |
| Gemma-3-TAIDE-12b-Chat | 2025/08 | Gemma 3-12b | 強化辦公室任務與多輪對話 |
| Gemma-3-TAIDE-12b-Chat-2602 | 2026/02 | Gemma 3-12b | 加強台灣文化/地理/歷史、修正翻譯腔、複雜指令 |
| Embeddinggemma-GTAIDE-300m | 2026/06 | — | 正體中文法規檢索的 embedding 模型 |
特色能力
- 嚴把訓練資料:這是「可信任」的核心賣點
- 擴充 24,720 個繁中字元/詞,強化正體字處理
- 強化辦公室任務:自動摘要、寫信、寫文章、中翻英、英翻中
- 加強台灣在地文化、用語、國情知識
- 多輪對話、長文處理
- 有 4-bit 量化版(資源少也能跑)、Qualcomm 手機優化版
- 最新 2602 版特別「修正翻譯腔」,讓輸出更像台灣人日常用語
評估表現
- 官方 benchmark(taide-bench,500 題)用 GPT-4 評分,涵蓋寫文章/寫信/摘要/中英互譯
- 行政院表示:五大任務表現可與 ChatGPT 3.5 相當,且能阻絕不恰當回應
- 也參與 CLongEval 長文評測
取得與授權
- 官網 taide.tw 下載、HuggingFace(
taide/組織)、GitHub 都有 - 授權依基底而異:Llama 版循 Llama 條款、Gemma 版循 Gemma 條款(部分版本商用需申請);分可商用與學研用
- 8B|12B 量化後可在一般工作站/消費級顯卡實測
應用生態
- 已落地 7 個領域,例如農業知識檢索**「神農 TAIDE」、中小學臺語教學**等
- 配合「主權 AI」政策(TAIWAN AI RAP)持續擴散
它的定位
TAIDE 的價值不在跟世界旗艦比世界知識,而在——正體中文、公文、台灣行政與在地用語的固定基線。對重視正體中文品質、需要資料主權或地端部署的台灣企業與公部門,它是很實用的基礎模型候選;而且愈來愈「像台灣人講話」(翻譯腔修正),很適合做在地應用。
資料來源:TAIDE 官方網站(taide.tw/taide.tw/en)、行政院新聞稿(2024/05)、HuggingFace taide/ 模型卡。