在资产管理中,模型正在变成商品
- Lingxiao Xu
- 7月4日
- 讀畢需時 15 分鐘
在资产管理中,模型正在变成商品

近期这项基准测试最重要的启示,并不是某个专有投资模型在一个狭窄的金融信息筛选任务上击败了几种前沿模型。更深的启示是,资产管理正在进入一个新阶段:机构知识可能比底层人工智能模型本身更有价值。对于一个痴迷最新基础模型、最大上下文窗口和最新排行榜的市场来说,这听起来有些反直觉。但投资机构并不是靠拥有通用智能获得持久收益。它们靠的是在不确定性、不完整信息和制度约束下做出更好的决策,并形成能够穿越市场周期的可重复流程。
这组数字很有冲击力。在一个围绕金融信息筛选任务构建的基准中,包括GPT 5.5、Claude Opus 4.8和Gemini 3.1 Pro在内的领先前沿模型,据称准确率约为74%到78%,每1000个任务成本约为20到95美元。Bridgewater基于多年专家标注投资决策训练的专有模型,据称准确率达到84.7%,每1000个任务成本约为5美元。两者结合比任何单一数字都更重要。它意味着更高质量和更低边际推理成本同时出现。按照该基准的表述,内部模型取得了最强结果,并且相对于某些前沿替代方案,推理成本低约13.8倍。
对资产管理公司来说,含义非常直接:下一轮竞争前沿,不只是采用最新通用模型,而是系统性捕捉、结构化、标注和训练专有研究、投资决策、风险复盘、组合讨论和机构判断。基础模型可以提供语言流畅度、一般推理、代码能力和广泛世界知识。但它不会自动知道某个投资委员会为什么在2018年拒绝一笔交易,为什么某位组合经理相信一个通胀指标却忽略另一个,某个信用团队如何在违约周期后修改契约风险框架,或者某个宏观信号为什么只有在流动性条件越过阈值后才有意义。
这些知识不是公开的。它们并不整齐地存在于教科书中。很多时候,它们甚至没有整齐地存放在公司内部。它们存在于会议记录、分析师备忘录、旧模型版本、事后复盘、交易理由、风险例外、客户信和资深投资人的心智模型里。能够把这些原始机构沉淀转化为高质量AI训练资产的公司,可能拥有真正优势。只是购买最新外部模型访问权的公司,可能只拥有一个暂时的生产力工具。
这是一个用新技术包装起来的经典资产管理道理。Alpha很少来自和所有人使用同一个公共信号。它来自专有信息、更优解释、更好组合构建、更强执行和更有纪律的风险管理。在AI时代,同样逻辑仍然成立。如果每家公司都能通过API调用同一个前沿模型,模型本身就不太可能成为持久壁垒。壁垒来自公司教给模型什么,把模型嵌入什么流程,以及模型能从什么决策历史中学习。
这项基准真正衡量的是数据质量,而不是模型声望
通用前沿模型在巨大语料上训练。规模赋予它极大广度,但广度不等于投资相关性。金融信息筛选是一个专业任务。它需要区分信号和噪音,理解语境,分类相关性,识别市场含义,并抑制表面合理但实际无关的信息。这些能力更少取决于通用语言能力,更多取决于公司希望模型学习什么样的决策边界。
从机器学习角度看,专有模型似乎受益于更好的任务特定训练分布。多年专家标注的投资决策不只是样本,而是压缩后的机构偏好。它们揭示了组织认为什么重要、忽略什么、什么被视为依赖市场状态,以及如何把信息转化为行动。由经验丰富投资人构建的标签,包含一种通用模型很难从公开文本中推断出来的监督信号。
这很重要,因为金融世界充满模糊事实。一份疲弱的制造业调查,在不同起点估值、通胀背景、政策反应函数和市场仓位下,可能对周期股利空、对久期利多、对某家软件公司无关,也可能利好央行宽松交易。通用模型可以描述所有这些可能性。基于公司自身决策历史训练的专有投资模型,可以学习公司真正关心哪些区分。
差异不仅是准确率,也是校准。投资机构并不需要一个在所有话题上都听起来聪明的AI系统。它需要一个知道公司何时会把信息视为可交易、何时会放弃、何时会升级给行业专家、何时会触发风险管理例外的系统。输出必须适合生产流程,而不是课堂作文。
因此,几个百分点的准确率提升可以有真实经济意义。在高频信息筛选任务中,从76%提高到84.7%不是表面改善。它意味着更少误报浪费分析师时间,更少漏报错过重要变化,并在注意力稀缺下实现更好优先级排序。在投资机构里,注意力是一种稀缺资产。能够在正确时间把正确信息传递给正确专家的系统,可以改善整个研究生产函数。
成本结果同样重要。如果前沿模型每1000个任务成本为20到95美元,而专有系统约为5美元,内部系统就能更广泛部署。更低推理成本会改变行为。团队可以运行更多筛选,测试更多变体,监控更多资产,并把AI用于那些使用昂贵推理时不经济的低价值但高频流程。在生产环境里,成本不是脚注。它决定技术进入运营模型的深度。
专有标签为什么会成为复利资产
最强的机构AI系统不会只来自静态档案。它们会来自反馈循环。每一次投资决策、研究审查、交易复盘和风险会议,都可以成为新的标注样本。随着时间推移,公司会建立一张不断扩大的世界解释地图。模型改善不是因为公共互联网改善,而是因为机构自身判断变得更结构化。
这创造了一种类似组织学习的复利动态。组合经理做出判断。该判断连同投资 thesis、证据、分歧、仓位逻辑和后续结果一起被记录。之后,公司复盘这项决策是因为正确理由而正确,还是因为可预见原因而错误,或者只是靠运气正确。这个复盘会成为训练材料。模型不只是学习最终结果,也学习推理路径和错误模式。
在金融中,这个区分至关重要。一笔赚钱交易,如果 thesis 错了而运气介入,可能仍然是坏决策。一笔亏钱交易,如果预期价值为正且不利结果位于已知分布内,可能仍然是好决策。有用的AI系统必须学习这种流程纪律。它不应该只是模仿赢家,而应该学习公司如何区分流程质量和已实现P&L。
这正是专有数据不同于公共数据的地方。公共市场数据可以告诉所有人价格发生了什么。公开文件可以告诉所有人公司报告了什么。新闻流可以告诉所有人宣布了什么。它们不会告诉所有人,一家精英投资组织如何解释这些信息、如何辩论、如何设定仓位、如何对冲,以及如何从中学习。这个解释层才是护城河。
这个观点可以连接到Jay Barney等学者提出的企业资源基础观。持久竞争优势来自有价值、稀缺、难以模仿且嵌入组织的资源。通用基础模型有价值,但如果每个竞争者都能访问,它就不稀缺。专有决策历史更可能稀缺且难以模仿。它也嵌入组织,因为它反映人、流程、文化和累积错误。
这里也有知识管理维度。Nonaka关于隐性知识和显性知识的区分很有用。许多投资能力是隐性的:它存在于直觉、模式识别和经验中。AI不会神奇吸收隐性知识。公司必须把足够多隐性知识转化为显性、结构化、可复查的材料。做得好的组织不仅会训练出更好的模型,也会让自己的投资流程更可解释。
这就是隐藏收益。建设机构AI系统会迫使公司定义什么是好判断。什么是重要宏观意外?什么让信用恶化变得可行动,而不只是有趣?估值缺口什么时候重要?公司应该如何权衡模型输出和定性管理层评估?这些问题在模型训练前就有价值。标注过程本身就是一种机构自我审视。
重复性工作流的经济性偏向专用模型
这项基准还说明一个重要经济问题:最适合某项任务的模型,不一定是可用的最大模型。在重复性生产工作流中,相关目标不是最大通用能力,而是针对具体任务,在准确率、延迟、可靠性、可解释性和成本之间取得最佳组合。如果一个更小或更专门的模型基于正确数据训练,并部署在正确流程中,它就可能占优。
这与工业技术采用很相似。企业很少给每项工作都使用最强大的工具,而是使用最匹配的工具。高端前沿模型可能非常适合开放式推理、复杂综合或需要广泛世界知识的任务。但对于分类、分流、抽取、路由和领域特定筛选,专用模型可以更便宜、更快、更一致。
资产管理有许多这样的流程。新闻相关性筛选、业绩会重点提示、契约抽取、组合风险预警、宏观数据分流、研究备忘录检索、可比公司匹配和客户报告起草,都有不同错误容忍度和不同单任务经济价值。为所有这些任务支付高级推理价格可能效率不高。分层架构更合理:专门内部模型处理频繁领域任务,前沿模型保留给复杂推理和升级场景。
简单成本公式很有启发。假设一家公司每年运行1000万次信息筛选任务。每1000个任务5美元,推理成本约5万美元。每1000个任务70美元,成本为70万美元。相对于大型资管公司的收入,这个美元差额可能不算巨大,但行为差异很大。在低成本下,团队可以自由实验。在高成本下,使用会被配额、监控,并通常限制在显而易见的高价值场景中。
再加入准确率。如果更便宜的系统在该任务上也更准确,经济性就非常强。公司得到更好输出、更低成本和更广泛部署。因此,84.7%准确率和约5美元每1000任务的组合,不只是技术趣闻。它指向一种运营模型优势。
这并不意味着前沿模型无关。它们作为通用推理引擎、代码助手、研究副驾驶和编排器仍然极有价值。但它们可能越来越多地位于专门机构模型之上或旁边,而不是取代它们。资产管理中的AI架构,可能不像一个巨型模型,而更像一个组合:基础模型负责广泛认知,专有模型负责机构判断,确定性系统负责数据完整性,人类专家负责问责。
这个架构本身类似组合构建。多元化组合不会只因为某项资产独立预期收益最高而持有它。它会组合不同风险、成本、流动性和相关性的资产。稳健AI栈也会组合不同优势的模型。前沿模型是一项资产。专有知识模型是另一项资产。优势来自组合,而不是模型极大主义。
真正护城河是投资决策供应链
机构知识这个词可能显得抽象。实践中,它意味着完整决策供应链:获取信息、分类相关性、形成假设、讨论替代方案、设定风险规模、监测结果和更新信念。专有AI系统真正强大,是当它不仅训练于最终决策,也训练于整条判断链。
以宏观研究流程为例。一份数据发布。第一个问题是它相对于预期是否真正意外。第二个问题是这个意外是否改变增长、通胀或政策分布。第三个问题是市场是否已经定价这种变化。第四个问题是组合是否有受益或受损敞口。第五个问题是交易应该通过利率、外汇、股票、信用、波动率还是相对价值表达。每一步都包含判断。
通用模型可以很好总结数据发布。专有模型可以学习公司偏好的问题层级。它可以知道公司把哪些通胀分项视为持久,哪些劳动力指标领先,哪些全球数据会影响国内政策,哪些市场价格最有信息量。它也可以学习公司的风格:偏好非对称期权、现金交易、相对价值表达,还是更慢的组合倾斜。
对信用投资,同样逻辑成立。一份文件可能揭示杠杆、流动性、契约变化、营运资本压力或管理层语气。公共模型可以抽取事实。机构模型可以学习哪些组合历史上会触发分析师升级,哪些行业可以承受更高杠杆,哪些保荐人行为重要,以及公司如何区分暂时压力和永久减值。
对股票投资,专有知识可能包括分析师如何评分管理层可信度,如何评估盈利质量,如何讨论竞争优势,以及什么时候估值纪律压倒叙事动量。这些判断很少能化简为单一公式。但它们可以通过结构化标签、样本、评分框架和事后复盘被捕捉。
因此,最强的公司会把投资流程视为数据基础设施。每份备忘录都是潜在训练对象。每个委员会决策都是标注案例。每个被拒绝的想法都是有用负样本。每次复盘都是校正信号。目标不是把投资人从流程中自动化掉,而是让机构最好的判断可以复用、搜索、测试和规模化。
这就是护城河难以复制的原因。竞争者可以买到同样模型订阅。它不能轻易买到几十年的内部辩论、错误、改进和文化。它无法复制形成另一家公司判断的具体决策序列。即使它能拿到文件,也缺乏赋予这些文件意义的组织语境。
治理和错误控制会变成核心
专有AI优势不是自动产生的。基于机构历史训练也可能编码机构偏见。如果公司有盲点,模型可能学会盲点。如果标签反映的是声音最大的人的意见,而不是最好的推理,模型可能复制层级而不是判断。如果历史决策来自不同市场制度,模型可能过拟合到一个已经不存在的世界。
这是核心治理挑战。机构知识有价值,但必须被策展。公司需要关于市场制度、资产类别、决策期限、置信度、分歧、结果和流程质量的元数据。它需要区分专家标签和噪音标签。它需要知道什么时候某个历史样本应该被降权,因为市场结构已经变化。
Andrew Lo的适应性市场假说在这里很相关。市场会随着参与者适应、竞争和学习而演化。基于旧决策训练的模型,不能假设环境平稳。投资知识不是固定物理定律,而是一组可能衰减、反转或变得拥挤的条件模式。因此,好的机构AI系统必须包含制度意识和持续评估机制。
风险管理也必须明确。错误筛选信息的AI模型会制造隐藏运营风险。漏报尤其危险,因为它会在需要注意的地方制造沉默。错过契约恶化、政策转向或流动性警告,可能比误报更昂贵。生产系统需要置信分数、升级阈值、审计轨迹和人工覆盖。
还有一种自我强化文化的危险。如果模型训练于公司的历史偏好,它可能让公司变得更加像过去的自己。当文化有纪律时,这可能很好;当世界变化时,这可能危险。模型应该保存机构记忆,但不能冻结机构想象力。它应该帮助投资者提出更好的问题,而不是只是重复旧答案。
最佳方法可能是混合式。专有模型处理机构相关性和流程适配。前沿模型挑战假设、寻找外部类比并生成替代假设。人类继续为决策负责,尤其是在风险高、语境不完整的地方。目标不是崇拜模型,而是建立更好的决策系统。
对资产管理公司的含义
对大型资产管理公司来说,信息很紧迫。AI战略应该从知识架构开始,而不是从供应商选择开始。关键问题不只是用哪个模型,而是公司能构建什么专有语料,如何标注这个语料,谁负责标签质量,如何捕捉反馈,以及模型输出如何进入投资流程。
公司应该盘点自己的机构知识。研究档案、交易理由、投资委员会记录、风险复盘、分析师模型、客户信和事后复盘,都应该被视为战略资产。这项工作并不光鲜。文件必须被清洗、授权、分类,并与结果连接。但这恰恰是持久优势可能形成的地方,因为多数竞争者会偏好更容易的路径:买一个工具,然后称之为转型。
标签也应该被精心设计。相关或不相关这样的标签可能太粗。更好的标签可能包括时间维度、资产类别相关性、置信度、预期方向、组合紧迫性、制度依赖,以及信息应该触发研究、风险审查还是交易讨论。更丰富的标签会产生更好的模型,也会产生更好的机构学习。
对较小管理人来说,结论并不绝望。它们可能没有几十年内部数据,但仍然可以从今天开始构建专有流程数据。聚焦型管理人可以用更高质量标注更窄的投资宇宙。它可以围绕特定策略建立更尖锐的工作流。在AI中和投资中一样,如果任务选择得好,专注可以弥补规模。
对资产配置者和客户来说,尽调问题应该改变。只问管理人是否使用AI已经不够。所有人都会说是。更好的问题是:什么专有数据训练系统,标签如何创建,错误如何衡量,人工问责如何保留,模型如何更新,AI是否改善了真实决策质量,而不只是提升了展示速度。
对投资公司内部员工来说,信息也很清楚。最有价值的专业人士,不会只是那些会写AI提示词的人,而是能把专家判断转化为结构化流程、建立反馈循环、评估模型错误,并在保留投资推理细微差别的同时让它可被机器使用的人。当领域专业知识可以被编码进系统时,它会变得更有价值,而不是更少。
这会如何改变行业内部竞争
战略后果是,AI可能扩大那些已经拥有强投资文化的公司与主要拥有渠道能力的公司之间的差距。在早期技术周期中,软件常常帮助较弱流程变得更有效率。这一次,技术可能奖励拥有最丰富流程记忆的组织。如果模型从公司学习,那么公司过去几十年做过什么、如何做,就变得重要。薄弱档案会产生薄弱老师。深思熟虑的档案会产生异常有价值的老师。
这带来几个竞争含义。第一,资深投资人的判断价值可能上升,因为它不再只是当前决策输入,也成为训练输入。一位合伙人的洞见过去只影响会议室里眼前那笔交易。如果被妥善捕捉,它现在可以影响未来成千上万次筛选、路由和研究决策。编码专业知识的边际价值上升,因为专业知识可以以机器规模被复用。
第二,拥有严格复盘文化的公司会拥有更好的数据。许多投资组织记录原始 thesis,却没有足够记录后来什么被证明正确、什么被证明错误。这会在知识库中制造幸存者偏差。模型看到的是自信备忘录,而不是后来关于洞见和叙事的区分。系统性复盘决策,包括被拒绝的想法和错误,会给模型一张更平衡的判断地图。
第三,学习速度可能成为差异化因素。在公开市场中,信息优势衰减很快。但如果每个周期都改善下一个周期,流程优势可以复利。能够把每个财报季、宏观冲击、信用事件和风险复盘转化为结构化反馈的公司,会比把AI当作静态搜索界面的公司学得更快。模型不再只是资料库,而是带有更新机制的记忆系统。
第四,人才战略会变化。最重要的招聘可能既不是纯机器学习工程师,也不是纯组合经理,而是能在投资判断和机器可读结构之间翻译的人。这些人理解为什么某个标签重要,什么时候历史样本会误导,组合语境如何改变相关性,以及如何设计投资者信任的工作流。他们是研究、工程、数据治理和风险之间的连接组织。
最后,行业可能分化为通用AI采用和专有AI整合。通用采用提升生产率:更快摘要、更干净草稿、更容易编码、更快检索。专有整合改变投资流程本身:什么被注意到,什么被升级,风险如何被表述,决策如何被复盘。前者有用,后者具有战略意义。
机构智能的实用架构
严肃的资产管理AI架构大概应该有四层。第一层是受治理的数据摄取:市场数据、文件、电话会记录、研究文档、组合数据、风险报告以及经过授权和清洗的内部沟通。没有这一层,模型就在混乱且有法律风险的底层材料上运行。
第二层是语义结构。文档需要实体、日期、资产映射、策略标签、决策类型、置信分数以及与结果的连接。这是许多AI项目失败的地方。它们以为把文档倒进向量数据库就足够了。并非如此。缺乏结构的检索往往返回看似合理的片段,而不是决策相关语境。公司需要的是自身流程的知识图谱,而不只是一堆嵌入向量。
第三层是模型专门化。有些任务应该由小分类器处理,有些由检索增强系统处理,有些由微调领域模型处理,有些由前沿模型处理。正确架构会按照经济价值和错误容忍度路由任务。低风险文档分流任务不应该消耗与高风险投资建议相同的资源。高风险决策也不应该交给不透明的一次性答案。
第四层是人工审查和反馈。每个生产系统都应该收集输出是否有用、错误、不完整、迟到或路由错误。反馈应该足够容易让投资者提供,也足够结构化以便训练。如果反馈太麻烦,就不会被收集。如果反馈不结构化,就无法复利。
这个架构也说明了这项基准真正指向什么。胜出的系统不只是一个更便宜的模型。它证明,当任务、数据、标签和工作流对齐时,专门化机构模型可以胜过更广泛的系统。教训是架构性的,而不只是统计性的。
结论:下一个优势是被组织起来的判断
这项基准的标题很容易被理解为模型赛马。这是最不有趣的解读。更重要的结论是,在特定投资工作流中,被组织起来的机构判断可以胜过通用智能,而且可以以更低成本做到。这对资产管理是一个深刻信号。
前沿模型会继续进步。它们的通用能力会扩展,每家严肃投资公司都会使用它们。但广泛可得性会降低排他性。如果一个工具所有人都能使用,它可以提高行业生产率,却未必给任何一家机构带来持久alpha。持久优势更可能来自专有知识:竞争者难以复制的研究历史、决策纪律、标签、辩论、错误和流程记忆。
赢家不会只是把AI接到旧研究流程上。它们会把研究流程变成学习系统。它们会捕捉决策,标注判断,复盘错误,并用机构累积智能训练模型。它们会在需要广度的地方使用前沿模型,在需要机构相关性的地方使用专有模型。它们会理解,投资中的AI优势主要不是拥有最聪明的通用模型,而是拥有组织得最好的判断。
在那个世界里,模型更接近基础设施,知识库才是资产。资产管理一直是一门让洞见复利的生意。AI不会改变这一点。它只是提高了那些能够有意识、有结构、规模化复利洞见的公司的回报。



留言