近期,Interactive Brokers 宣布,用户可将 ChatGPT、Claude、Grok 等大语言模型直接接入投资账户,用于市场研究、投资组合分析,乃至生成交易指令。大语言模型正从“回答问题”“生成内容”的对话工具,演化为能调用外部工具、连接真实系统、参与复杂决策的智能体。随着 AI 迈进真实场景,一个更具现实意义的问题随之浮现:当它们持续参与现实金融决策时,表现究竟如何?
为探究这一问题,香港大学经管学院人工智能评估实验室(AIEL)开展了一项实时外汇交易实验。10 个主流大语言模型——包括 GPT、Claude、Gemini、DeepSeek、Qwen、Grok、GLM、Kimi、MiniMax 和 Seed(Doubao)——在相同初始资金、交易工具与杠杆约束下,基于真实市场数据持续进行模拟交易。它们每个小时获取一次最新市场信息,自主判断是否检索新闻、分析行情或调整仓位。所有决策均基于实时数据完成,实验有效规避了训练数据与评测数据重叠可能带来的数据污染风险。
自2026年4月启动以来,经过六周运行,不同模型在交易行为和收益表现上呈现出明显分化。部分模型实现了接近两位数的累计收益率,例如Qwen3.5 Plus和Kimi K2.5;而MiniMax 2.5和DeepSeek V3.2则出现了较大亏损。值得注意的是,这一结果与我们此前发布的推理能力评测 或Chatbot Arena + 通用能力榜单并不完全一致——在推理、知识问答或代码生成任务中表现领先的模型,未必能在真实金融市场中斩获最佳收益。