
导读:对大智慧而言,这场改造的意义不只是在产品里加了一个 AI 对话框,而是重新定义了金融软件与用户的关系。从提供数据的工具变为理解需求的伙伴。
文/郭虹妘
金融业是数字化、智能化的先行者,也是大模型技术落地的绝佳领域。从早期的电子交易系统到如今的智能投顾,技术每一次迭代都重塑着这个行业的运行逻辑。
当大模型的热潮席卷各行各业时,一个更深层的命题摆在传统金融软件商面前,如何将多年积累的数据资产与业务理解,转化为真正可用的智能能力,而非简单地接入一个 AI 对话框。金融数据是一个极其丰富、复杂的数据资产池,数据含义、口径、来源、时效性,每一个信息的偏差都可能让 AI 输出错误的回答,从而误导用户决策,这不仅是简单的财务损失,而是彻底摧毁用户的信任。所以,金融行业的 AI 改造,并不是接入一个大模型接口就能交差,而是要从底层数据治理到上层交互逻辑,完成一场由内而外的重构。
大智慧正是这样一个样本,与阿里云联手,启动了一场从看行情到懂投资的跃迁实验。
AI 时代进化破局
大智慧是国内最早一批金融信息服务软件商,从 2000 年成立至今,产品覆盖 PC 端和移动端,拥有超过二十年的金融数据积累和数以千万计的用户基础。从早期的行情查看工具到如今的数据分析平台,大智慧一直在探索如何让金融数据更好地服务于投资者的决策。
当 AI 大模型时代到来,一个根本性的问题摆在了他们面前,如何让一个看行情的工具,进化成为真正懂投资的智能伙伴。阿里云分析行业后得出结论,如果只是停留在问答的阶段,大家提供的服务是类似的。传统行情软件的 AI 化改造,需要的是一场从底层数据到应用架构的全面重构。传统金融行情软件的增长早在 AI 大模型出现之前已经见顶,行业普遍面临三大困境:第一是服务同质化。当所有软件都能提供相似的行情数据、技术指标和资讯信息时,用户很难感受到差异化的价值。数据摆在那里,但如何将数据转化为判断、将判断转化为行动,才是真正的痛点。第二是使用门槛高。量化回测、专业指标分析等高级功能虽然强大,但普通投资者往往望而却步。但AI可以把科学炒股的门槛降得更低,让更多人用得起、用得上。这背后的核心愿景是投资平权,让专业级的分析能力不再只是少数人的特权。第三是不够智能化。投资不是一次性决策,而是需要持续跟踪、动态调整的长期过程。用户需要的不仅是一个查询工具,而是能够理解其投资目标、在关键时刻提供建议的助手。AI 产品形态除了辅助客户做投资决策之外,还能做用户的助理。
2024 年夏天,经过两个多月的深入沟通,阿里云和大智慧明确了 AI 原生 APP 的共创方向,当年 10 月项目正式启动。双方目标不是简单地将金融软件接入大模型,而是让大智慧从传统行情软件升级为能够理解用户意图、主动分析数据、辅助投资决策的智能产品。
重构,AI 原生架构的四大关键要素
项目启动后,摆在双方团队面前的首要问题是技术路径怎么选。大智慧有海量的金融数据,大模型有强大的语言理解能力,那么通过 RAG 检索或 Web Search 的方式把数据喂给大模型,是不是就能让它很好地服务客户?然而,双方在实际测试中发现这样做不行,模型幻觉的问题很难解决,对客户的实际价值也不大。
问题的症结在于,金融数据不仅仅是数据,它有复杂的语义、多元的口径、内外部数据的冲突。阿里云认为需要回到客户自己业务本身的环节当中,理解客户选股是什么流程、需要用到哪些数据、这些数据哪些是真实的、哪些有冲突......经过反复探索,双方团队意识到,Agent 从概念走向工程化落地,需要在四大关键要素层面下功夫。
关键要素一:数据治理,用户从人变成 Agent。大智慧积累了二十余年的行情数据、财务数据、资讯数据,加上实时的市场数据,构成了一个极其丰富、复杂的数据资产池。这些数据原本是为“人”设计的,分析师能够凭借经验判断不同数据源之间的口径差异,但大模型做不到。
例如,同一只股票的涨跌幅在不同数据源中可能有不同的计算方式;市盈率可能因采用的财务周期不同而产生差异。这些对人类分析师而言可以通过常识判断的歧义,对大模型来说却是致命的陷阱。因此,数据治理成为整个项目的奠基性工作,将数据的含义、口径、来源、时效性进行系统化的梳理和标注,消除歧义,统一指标口径,把“给人用的数据”变成“给 Agent 用的数据”。 但事实上这一转变背后工作量极大。 大智慧的数据散落在各个系统,行情数据、财务指标、资讯文本各自在不同的数据库中,元数据建设复杂万分,数据体量极其庞大。如果按照传统思路从下往上建一个数据中台再逐步治理,周期漫长且难以匹配业务节奏。
阿里云的做法是从上往下、按场景切入。围绕高价值业务场景圈定数据范围,避免全量重建数据中台,提升效率。在这个过程中,双方共同协作,阿里云选择“授人以渔”,提供方法论指导和技术支持,关键场景打样后由客户自主推进,由此,客户便能在后续更新的数据和场景中实现自主建设。
关键要素二:Agent 工程框架,从问答到任务执行的进化。数据底座打好之后,接下来是 Agent 平台的建设。FinXScope 2.0 是阿里云构建的面向通用金融场景的 Agent 平台,也是大智慧 AI 原生改造的中枢神经系统。
用户希望通过自然语言表达自己的投资目的,由 Agent 自主拆解任务、辅助完成决策,而不是自己再去找各种各样的行情、翻资讯、写条件、调指标。这意味着 Agent 需要具备理解用户意图、拆解为子任务、规划执行顺序、调用工具和数据、整合结果、生成可解释的输出的能力,这背后是一整套的工程框架。任务编排层,负责接收用户自然语言输入后,完成意图识别、任务拆解和执行规划。这是 Agent 的大脑,决定先做什么、后做什么、调用哪个工具。用户说帮我找低估值高增长的白酒股,编排层会将这条自然语言拆解为行业筛选→ 估值指标查询→增长指标查询→综合排序的执行链路。
工具执行层,Agent 的能力最终要落地到具体的业务场景中。选股分析、财报解读、盯盘监控、条件选股、技术指标分析,每一个场景都需要一套完整的能力闭环。Skill 技能体系将这些高频复用的业务能力封装为标准化的技能模块,让 Agent 可以按需调用、灵活编排。目前Skill体系已覆盖六大类别:行情数据查询类(涨跌幅、成交量分析)、选股类(条件选股、自然语言选股、多因子选股、基本面 / 主题选股)、大智慧特色指标类(二十年沉淀的特色因子、指标组合与历史回测)、资讯研报 F10 类、交易辅助类(覆盖盘前市场研判、盘中信号识别、盘后全市场标准化复盘等),以及 B 端企业问数类(经营问数、客户数据分析、运营指标)。
安全沙箱层,这是解决 AI 幻觉问题的关键工程手段。阿里云的设计理念中,大模型是“大脑”,Skill、 MCP、执行环境是“手”。所有涉及数据事实的操作,比如资金数字、行情查询、指标计算都放在 Skill 和沙箱中执行,不让大模型自主发挥生成事实类数据。大模型的工作是编排规划,让“手”去执行动作、拿到真实数据后再反馈给用户。通过这种“大脑 + 双手”的 Harness 工程架构,从根本上控制模型幻觉。
关键要素三:记忆体系,让 AI 真正了解用户。一个真正智能的投资助手必须拥有记忆。阿里云将大智慧的 AI 记忆体系归纳为四个层次:第一层是长期稳定记忆,核心沉淀用户标准化画像信息,涵盖风险偏好、高频复用技术指标、惯用选股逻辑、偏好分析周期、常用复盘维度、关注赛道风格等长效固定特征;这些数据在用户注册和使用过程中已经沉淀,是 AI 理解用户的基础;第二层是行为操作记忆,存储用户交互操作轨迹,包含条件选股参数设置记录、指标组合自定义配置,需脱敏与审计;第三层是交互历史记忆,如历史问答记录、关注过哪些股票、偏好什么样的回答方式,这些是长期积累的交互记忆,存储在低频的大容量存储中;第四层是短时上下文记忆,如当前对话的短期记忆,按时效性要求分层存储,时效性要求高的放在快速的结构化存储,长期历史放在低频大容量存储,对话中按需要分层检索、拼装出当前对话需要的上下文。
具体来看,在每次对话中,系统不是把所有记忆一股脑塞进上下文,而是根据当前对话的需要,从不同层动态检索、按规则拼装出最适合的上下文,哪些画像标签要带入、哪些历史交互需要参考、哪些短时信息必须保留,这里面既有大量细粒度的工程规则,也有需要模型自主判断的内容。正是这种“分层存储 + 按需检索 + 动态拼装”的工作机制,让 AI 既能记住用户,又不会因为记忆过载而影响响应质量。
关键要素四:评测体系,让 Agent 真正有用。Agent 落地过程中,双方团队遇到的最大挑战不是技术实现,而是怎样评判一个 Agent 做得好还是坏。这个问题分两种情况:有标准答案的场景,如选股,可以建出标准评测集,快速迭代提升准确率;但没有统一标准的场景,如诊股分析、发散性问题,才是真正的难题,每家的业务场景不同,评判维度也不同,必须和客户一起从零设计评测体系。
双方的做法是人机协同评测。一方面,人工一条条构建评测集、逐条过审;另一方面,用大模型自动化打分,设计多维度评测指标。同时通过线上灰度发布收集真实用户数据,用实际业务反馈驱动迭代优化。这套评测体系贯穿项目始终,是保证 Agent 质量持续提升的核心机制。
全栈支撑与工程落地能力
四大关键要素的落地,离不开阿里云从底层到上层的全栈能力支撑,以及贯穿始终的工程化服务。
在算力层,金融场景对响应速度有极高要求,计算资源的弹性调度能力直接决定了用户体验。阿里云提供的支 撑分为两个维度:一是 GPU 与国产PPU(平头哥) 的推理算力,支撑客户自有模型部署场景;二是弹性通用算力。随着 Agent 从问答形态转向自主执行任务,对弹性计算资源的需求急剧上升,沙箱、容器等多种形态的弹性资源成为平台运行的基础保障。
在模型层,千问系列模型经过多轮选型与调优。团队建立了一套完整的评测体系,对不同模型在金融场景下的表现进行系统性测试,比如问某只股票的市盈率是多少,测试模型的工具调用能力;再追问对比两只股票的市盈率谁更高,测试上下文理解和数据对比能力;最终,在综合质量和效率之间取得了最优平衡。阿里云的策略不是一个模型走到底,而是根据不同场景对智能化和时效性的要求,匹配不同尺寸的模型。大尺寸模型应对复杂推理场景,小尺寸模型应对简单高频场景。
以意图识别的优化场景为例,用户自然语言进入系统后,第一步就是意图识别,判断用户想做什么、走哪条执行路径。大智慧最初使用某模型厂商全尺寸模型做意图识别,一次调用就需要约 10 秒,还没开始干活,光判断走哪条路就花了 10 秒。这在金融场景中是完全不可接受的体验。阿里云分两步推进优化。第一步,缩小模型尺寸。 在意图识别这种短上下文、输入输出简短的场景下,全尺寸模型的能力并不能充分发挥,反而拖慢了速度。将模型尺寸缩小后,意图识别耗时降至 2-3 秒。 第二步,将意图分类训入小模型。 进一步发现,即使使用 4B 小模型,仍需要在提示词中注入大量意图分类定义,导致上下文过长。于是团队将意图分类直接训练到 4B 模型内部,模型只需接收用户输入即可输出分类结果,不再需要冗长的提示词上下文。最终,意图识别从 10 秒压缩到毫秒级别。
这种大模型做大脑、小模型做关卡的分层策略贯穿整个系统。针对客户场景做微调,既保证准确性又保证时效性,是阿里云在金融场景中沉淀的核心工程能力。
在平台层,FinXScope 2.0 作为通用金融场景的 Agent 平台,提供编排、规划、安全沙箱、弹性调度、 工具执行环境以及安全合规基础设施。它不是针对大智慧定制的单点 Agent,而是标准的 Agent Infra,在阿里云环境中有标准架构,在项目落地时通过适配客户场景、业务和基础环境做针对性改造,且可复用于其他金融客户。阿里云平台构成了第二引擎,提供一站式模型调用和应用搭建能力,让团队可以一行代码切换模型, 大幅降低工程成本。
在应用层,FDE 团队与大智慧共建了多个 AI 原生应用场景,从最初的选股场景,从解决自然语言到取数逻辑的准确率问题,到更深层的整股分析,双方花费大量精力设计评测维度、建立人机协同评测体系,再到今年的龙虾助手、任务助理形态的陪伴式产品。
贯穿算力、模型、平台与应用各层的,是安全合规保障。金融行业对数据安全和合规的要求极高,阿里云从三个层面构建安全体系:数据层面,用户数据历史问答进入记忆体系前必须经过脱敏处理和合规审计,所有数据治理工作在客户现场完成而非外传;执行层面,Skill 和沙箱机制确保大模型不直接生成涉及资金、收益的事实类数据,所有数据交互通过受控的工具链执行,大模型只负责编排规划;平台层面,FinXScope 2.0 内置安全沙箱、合规审计和权限管控基础设施,为金融场景的 AI 运行提供全链路的安全兜底。
在最后一公里的交付上,阿里云采用的是 FDE(驻场开发工程师)模式。从最小可验证的单元开始,快速打 样、快速验证。结合在售前阶段,阿里云团队就帮助客户制作 Demo,让客户直观感受 AI 能力是否符合预期,双方信任在这个过程中一步步建立,项目合作规模也会逐渐扩大。据悉,双方合作中很多场景是在售前阶段和客户一起探讨出来的,这些新场景带来的价值,就是 FDE 团队所带来的溢价。
大智慧的 AI 原生改造提供了一个典型的样本,但这并非终点。从 2024 年 10 月项目正式启动至今,大智慧的 AI 能力正在从 C 端用户向更广阔的领域延伸。除了面向个人投资者的智能投研助手,B 端机构服务、企业内部办公提效等场景也在同步推进。双方正在探索产品研发整个流水线的 AI 原生升级,也包括组织层面的 AI Native 升级。对大智慧而言,这场改造的意义不只是在产品里加了一个 AI 对话框,而是重新定义了金融软件与用户的关系。从提供数据的工具变为理解需求的伙伴。
对阿里云而言,大智慧是一个场景足够丰富、决心足够坚定的样本客户,让 FinXScope 2.0 从概念走向了真实落地,也让一套可复用的金融 Agent 平台得到了实战验证。
AI 原生不是终点,而是起点。当二十年的数据资产遇上大模型的理解能力,真正的跃迁才刚刚开始。