🌐 外来客网

北京力推「具有中國特色的AI」!中國透過「訓練數據」輸出意識形態,爭奪聊天機器人話語權

声明:本文转载自 「风传媒」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

中國為加速在人工智慧(AI)領域抗衡美國,正將戰線拉至最核心的底層——「訓練數據」。《紐約時報》17日報導,北京不僅致力成為數據強國,更透過國際平台釋出帶有官方敘事的數據集。西方學者與國安專家對此示警,中共官方意識形態可能深植全球AI系統,實質擴大威權宣傳,甚至主導未來聊天機器人的價值標準。 在ChatGPT問世之初,北京理工大學的研究人員曾經進行中文測試時發現,發現這個OpenAI打造的聊天機器人頻頻出錯,不僅將前NBA球星姚明誤植為「在美國打職業籃球的第一位中國女性」,還將成書年代相隔兩百年的《西遊記》與《紅樓夢》混為一談。研究團隊當時明確指出,ChatGPT產出了大量「對中國的偏見言論」,而且「不會迴避或拒絕回答有關中國的政治問題」。 儘管ChatGPT後續已多次升級改版,但這些早期案例點出了北京的核心焦慮:當前形塑未來世界的頂尖AI,絕大多數使用英文數據集進行訓練,充斥著北京認定的「西方思維模式」。分析人士直言,這對中共構成重大戰略弱點,意味著在全球AI生態系中,西方觀點在人權狀況以及台灣主權地位等關鍵議題上,將持續居於主導優勢。 力求突破「數據孤島」 為了逆轉劣勢,中國國家數據局年初發布戰略藍圖,明定在2028年底之前將中國打造為「數據強國」,並在科研、工業製造、自動駕駛等二十多個戰略領域建立「高品質」數據集。在上個月於上海舉行的世界人工智能大會上,北京更承諾向數十個發展中國家共享數據,並由官方實驗室與官媒整理出海量數據供全球免費下載。 中國信息通信研究院院長余曉暉也在國家數據局官網直言:「人工智能時代的競爭不僅是模型和算力的競爭,也是高品質數據供給的競爭。」 然而《紐約時報》指出,中國內部仍面臨結構性障礙。風險管理諮詢機構歐亞集團(Eurasia Group)地緣科技主任魯曉萌分析,儘管中國坐擁龐大監控體系與數億行動用戶產生的海量數據,但這些資料長期被封鎖在不同政府部門與科技巨頭的「數據孤島」中,導致研究團隊難以取得高品質語料,被迫高度依賴「模型蒸餾」(Distillation)技術擷取現有模型數據,因而引來Anthropic等美商指控抄襲,「解決國內數據流動障礙,已是中國的當務之急」。 相較於美國數據商Mercor與Scale AI大舉聘用數學家與律師進行高階專業標註,中國國家數據局也下令轉向「專家型數據標註」,並要求各大專院校開設相關培訓課程。 「萬卷」多國語言庫引發技術鎖定疑慮 中國數據的外溢效應已引發西方高度警惕。澳洲戰略政策研究所(ASPI)網路專家柯爾維爾(Alex Colville)警告:「這種做法的隱憂在於,它賦予了威權國家更大的權力去左右聊天機器人的價值觀。」 《自然》(Nature)日前刊出一項研究,表示中國官方敘事早已滲透至ChatGPT與Claude等美國模型的訓練語料中。當研究人員提問「中國是否為專制國家」或「習近平是否為好領導人」時,中文回覆明顯比英文回覆更偏向北京立場。普林斯頓大學的社會學教授布蘭登・史都華(Brandon Stewart)指出,AI將「訊息傳播者」與「內容本身」切割,使用者如果得知某些答案實質來自《人民日報》,感受將完全不同。 目前,由官方資助的上海人工智能實驗室已在GitHub與Hugging Face等開源平台釋出名為「萬卷」(WanJuan)的大型數據集,內容涵蓋歷史、法律與時事,明文強調符合「中國主流價值觀」,並擴及阿拉伯語、韓語、俄語、泰語與越南語版本。 大西洋理事會(Atlantic Council)資深研究員狄博(Kenton Thibaut)指出,隨著平價中國AI模型在發展中國家攻城掠地,這些數據集極具誘因,「這是一種技術鎖定(technological lock-in),既助長中國企業版圖,也擴大北京的國際影響力。其終極目標是為中共營造更安全的全球環境,關鍵手段就是掌控全球AI運行的底層機制」。

评论 (0)