來源:金十數據
18個主流AI模型在超過1萬次金融問題測試中,平均57%的回答存在錯誤;一旦問題涉及多步計算,平均錯誤率進一步升至88%。
生成式AI正在快速進入個人理財,但模型處理複雜金融問題的穩定性仍明顯落後於用戶採用速度。英國《金融時報》援引科技公司Saturn的測試稱,18個主流AI模型在超過1萬次金融問題測試中,平均57%的回答存在錯誤;一旦問題涉及多步計算,平均錯誤率進一步升至88%。
Saturn此次測試覆蓋100多類與金錢有關的問題,每道題最多重複五次,並同時比較免費和付費模型。結果顯示,問題並不侷限於算術失誤。部分模型會遺漏即將生效的稅制變化,還會生成實際上並不存在的金融規則。
在複雜問題中,一些模型的錯誤率甚至達到99%。即使是測試中表現最好的Claude Opus 5,在「推理」模式下仍有39%的回答出錯。
付費模型整體準確率高於免費模型,新模型也普遍優於舊模型。但Saturn的測試表明,即使表現最好的產品,目前也沒有達到可以穩定承接高風險個人財務決策的程度。
從回答錯誤到真實財務損失
稅務和養老金等領域最能說明問題。一旦模型給出的錯誤建議被用戶直接執行,錯誤就可能從信息偏差轉化為實際損失。
測試中,Claude Haiku 4.5曾錯誤解釋一項養老金稅務規則。如果用戶按照這一答案操作,可能因此面臨英國稅務海關總署1.75萬英鎊的稅費。
在另一次學生貸款測試中,模型則虛構出一條並不存在的規則,聲稱借款人「移居海外即可停止還款」。這類錯誤已經超出普通的信息檢索偏差,因為用戶可能據此直接調整自己的財務行為。
AJ Bell個人理財主管薩拉·科爾斯(Sarah Coles)表示,一些顧問已經接到客戶諮詢,原因是客戶此前獲得了AI提出的異常建議,希望專業人士確認這些操作是否已經造成後果。
科爾斯認為,需要實質性支持的消費者仍應尋求正規的專業建議,而不是直接依賴聊天機器人。不過,她並不否認AI在個人理財中的實用價值。
在預算整理、基礎研究以及根據收入和支出尋找潛在過度消費項目等低風險環節,AI仍可以發揮輔助作用。區別在於,這類任務允許用戶檢查和修正結果,而稅務、養老金和投資執行中的單次錯誤,可能直接帶來不可逆的財務成本。
AI需求正在進入專業建議的空白市場
風險尚未解決,用戶需求卻已經快速增長。英國金融行為監管局的調查顯示,約五分之一英國成年人願意讓AI替自己作出金融決定,需求尤其集中在債務、養老金和投資等複雜領域。
年輕投資者的接受度更高,其中約三分之二預計未來一年會增加AI使用。另一篇《金融時報》報道援引FCA此前的調查稱,接近五分之一受訪者已經使用AI幫助處理個人財務。
與此同時,英國成年人獲得傳統金融建議的比例仍然較低。同期只有約9%的英國成年人接受受監管的金融建議,這使低成本AI工具進入了一個長期存在專業建議供給缺口的市場。
這也是AI理財工具能夠快速擴張的重要背景。對於無法承擔傳統財富管理費用,或原本就不會主動尋找專業顧問的消費者而言,聊天機器人降低了獲取金融信息的門檻。
但低成本和高可獲得性並沒有同步解決準確性和責任問題。消費者越容易直接使用AI完成複雜決策,模型錯誤被轉化為實際損失的概率也越高。
AI更可能先改變顧問,而不是取代顧問
傳統財富管理機構目前仍擁有AI難以複製的一項優勢,即受監管顧問提供的持續服務和明確責任關係。
以英國大型財富管理公司St James’s Place為例,其約5000名顧問組成的合作伙伴網絡,被《金融時報》視為公司應對免費AI理財工具競爭的重要資產。對於客戶而言,人工顧問提供的不只是答案,還包括長期服務、具體責任以及出現問題後的處理機制。
AI的普及同時也在改變客戶對人工顧問的要求。《金融時報》分析稱,即使希望繼續保留人工服務的客戶,也會越來越期待顧問使用效率更高的技術工具。
如果AI能夠幫助顧問處理資料整理、初步分析和標準化流程,單個顧問能夠服務的客戶數量可能增加。由此來看,AI在財富管理領域更早出現的影響,可能是自動化顧問工作流,而不是直接取消受監管的諮詢關係。
目前最直接的制度問題仍然是責任歸屬。Saturn首席執行官阿邁勒·喬利(Amal Jolly)表示,消費者通過AI獲得金融建議時,並不能獲得與人工受監管顧問相同的保護和賠償機制。
喬利稱,FCA已經開始研究這一問題。但在AI用戶持續增加的情況下,消費者採用速度正在逼近現有監管邊界,如何界定AI提供金融信息與金融建議之間的責任,以及錯誤發生後由誰承擔後果,正成為個人理財市場必須解決的問題。