主權AI語料庫吸引逾50單位申請
台灣主權AI訓練語料庫自去年底推出以來,已成為人工智慧發展的重要基石。根據《中央社》報導,截至今年7月底,語料庫已累積提供約5000筆資料集,語料規模更突破20億詞元,展現其龐大潛力。
數發部(數位發展部)透露,已有59名個人或單位提出申請,表達使用這項珍貴資源的意願。其中不乏知名科技業者,例如凌群和華碩,顯示產業界對在地化AI訓練資料的高度重視。
擴增在地化內容 9月中啟動民間語料徵集
為了確保AI模型訓練的品質與在地化,台灣主權AI訓練語料庫積極納入高品質、具備台灣特色的正體中文語料。這些內容廣泛涵蓋文化、教育、語言、民俗、歷史、交通、法律等多元領域的專業知識,旨在支援AI模型更貼近台灣的應用發展。
數發部進一步說明,目前已有少量民間語料成功上架,但為了更全面地擴充語料庫的豐富度,預計將在9月中旬正式啟動民間語料的徵集作業,鼓勵更多單位與個人貢獻在地化的寶貴資料。
政府機關積極參與 貢獻龐大資料集
台灣主權AI訓練語料庫的建置,獲得超過200個政府機關的熱烈響應與參與。這些政府單位透過提供各項業務相關的資料,共同構築了語料庫的基礎架構。
累積至今的約5000筆資料集,以及超過20億詞元的龐大規模,正是政府機關與民間單位共同努力的成果,為台灣自主AI技術的發展奠定堅實基礎。






