Personal Knowledge Base

修哥筆記

「知識的沉澱與分享」

TAIDE:國科會打造的正體中文 LLM

TAIDE:國科會打造的正體中文 LLM

· #TAIDE #LLM #繁體中文 #AI #國科會 #技術隨筆

TAIDE(Trustworthy AI Dialogue Engine,可信任生成式 AI 對話引擎,民間常稱「臺版 ChatGPT」)是近年很受關注的台灣本土模型。本文整理它的背景、版本、能力與定位。

它是什麼

由**國科會(NSTC)**指導、國家實驗研究院(NARLabs/NIAR)執行,2023 年 4 月啟動。目標是做出符合台灣語言與文化特性、又「可信任」的正體中文大語言模型——減少對外國技術依賴、保護本國文化。

背景動機:國際大模型多數訓練資料是英文、中文偏簡體,回應常與台灣文化與價值觀脫節。TAIDE 就是用來補上這個缺口。

模型演進(一路換基底)

版本 時間 基底 重點
TAIDE LX-7B/LX-13B 2024/04 Llama 2 首發正式版(7B 可商用、13B 學研用)
Llama3-TAIDE-LX-8B-Chat-Alpha1 2024/04 Llama 3 搶先版(Meta 釋出後 4 天就做好)
Llama 3.1-TAIDE-LX-8B-Chat 2025/02 Llama 3.1 context 拉到 131K、繁中解碼快 20%
Gemma-3-TAIDE-12b-Chat 2025/08 Gemma 3-12b 強化辦公室任務與多輪對話
Gemma-3-TAIDE-12b-Chat-2602 2026/02 Gemma 3-12b 加強台灣文化/地理/歷史、修正翻譯腔、複雜指令
Embeddinggemma-GTAIDE-300m 2026/06 — 正體中文法規檢索的 embedding 模型

特色能力

  • 嚴把訓練資料:這是「可信任」的核心賣點
  • 擴充 24,720 個繁中字元/詞,強化正體字處理
  • 強化辦公室任務:自動摘要、寫信、寫文章、中翻英、英翻中
  • 加強台灣在地文化、用語、國情知識
  • 多輪對話、長文處理
  • 有 4-bit 量化版(資源少也能跑)、Qualcomm 手機優化版
  • 最新 2602 版特別「修正翻譯腔」,讓輸出更像台灣人日常用語

評估表現

  • 官方 benchmark(taide-bench,500 題)用 GPT-4 評分,涵蓋寫文章/寫信/摘要/中英互譯
  • 行政院表示:五大任務表現可與 ChatGPT 3.5 相當,且能阻絕不恰當回應
  • 也參與 CLongEval 長文評測

取得與授權

  • 官網 taide.tw 下載、HuggingFace(taide/ 組織)、GitHub 都有
  • 授權依基底而異:Llama 版循 Llama 條款、Gemma 版循 Gemma 條款(部分版本商用需申請);分可商用與學研用
  • 8B|12B 量化後可在一般工作站/消費級顯卡實測

應用生態

  • 已落地 7 個領域,例如農業知識檢索**「神農 TAIDE」、中小學臺語教學**等
  • 配合「主權 AI」政策(TAIWAN AI RAP)持續擴散

它的定位

TAIDE 的價值不在跟世界旗艦比世界知識,而在——正體中文、公文、台灣行政與在地用語的固定基線。對重視正體中文品質、需要資料主權或地端部署的台灣企業與公部門,它是很實用的基礎模型候選;而且愈來愈「像台灣人講話」(翻譯腔修正),很適合做在地應用。


資料來源:TAIDE 官方網站(taide.tw/taide.tw/en)、行政院新聞稿(2024/05)、HuggingFace taide/ 模型卡。

← 返回首頁