各执己见:机器仲裁成为新市场
作者:Thejaswini 来源:Token Dispatch 翻译:善欧巴,金色财经
我们似乎把整个文明建立在这样一个事实上:证据与认可,并不是同一回事。
人们默认研究者要引用真实、直接的来源;默认设计师明白「简洁」不等于交一张白纸;被要求做一个能跑通的结账流程的开发者,也默认不会让它加载四分钟。人类在承接这些未言明的语境上出奇地擅长,因为我们共享一套关于「合理的工作长什么样」的基本感觉。软件从来不太需要这些,因为我们通常给它的指令都窄到可以逐字执行。
如果你看过《奥维尔号》里那一段,就知道我在说什么:
AI 智能体开始在一个更混乱的世界里工作:指令不会把「怎样才算把活儿干好」全部写清楚。一旦钱挂在那些缺失的语境上,解读本身也就成了交易的一部分。
如果有人花 15 美元请一位自由职业者调研 20 家公司,任务说明也算清楚,他会期待什么?找到这些公司、说明每家是做什么的、使用独立信源,并在指定日期前交出报告。当成果按时交付、20 家公司一个不落,接活的人就认为活儿干完了。
买方的看法却不一样。几处引注指向的是公司自己的博客,还有两段描述几乎是逐字照搬。
如果双方都是人,接下来的戏码就是争论、甩截图、翻出原始任务说明来回扯。若仍然谈不拢,最终可能得由第三方来裁定这份活儿够不够格拿钱。
如果两边都是 AI 智能体,又会怎样?
钱本身并不难处理。
托管合约可以先扣住这 15 美元,直到活儿干完。
区块链能显示款项何时存入、成果何时提交。
身份系统可以确认到底是哪个智能体干的活。
签名记录可以留存双方当初约定的指令。
真正的难题在于:总得有人读懂任务说明、检查成果,判断卖方到底有没有把活干好。
商业世界一直有针对这类问题的机构,只是我们通常在出事时才会注意到它们。当 PayPal 的买家声称货没到、或者与描述完全不符,双方先有机会自行解决;如果谈不拢,一方可以把纠纷升级为索赔,请 PayPal 核查证据、判定谁有理。PayPal 称,多数裁决大约需要 14 天,少数要 30 天甚至更久。
更大的商业纠纷有自己的一套机器。美国券商归行业自律组织 FINRA 管,它运营着自己的仲裁论坛:2025 年收到 2,597 件新案,平均要 13.4 个月才结案。非营利机构美国仲裁协会表示,2025 年有 58 万件案子提交给它,其中企业与企业之间的索赔与反索赔金额超过 290 亿美元。同年,国际商会收到 881 件新仲裁案,其在办案件总值达到 2,990 亿美元。这些显然比智能体眼下可能遇到的纠纷大得多,但它们说明:一旦交易足够多,人们吵架的频率就足以催生一整个行业——专门看证据、判断谁该拿钱。
AI 智能体开始从另一端提出同类问题:交易金额可能极小而频率极高,传统的纠纷处理流程根本派不上用场。

Visa 和 Artemis 研究了两套面向机器对机器商务的新兴支付协议,发现 x402 自 2025 年 5 月上线到 2026 年 4 月,处理了约 1.096 亿笔经调整的交易,总价值约 1,500 万美元。在 Visa 考察的这些协议上,单笔支付平均只是几分之一美分。为了几美分的争议,雇一支人工客服团队花半小时去查,完全不划算。
我去查了查谁在做这件事,找到了 GenLayer,它想把这件事变成基础设施。
GenLayer 自己造了一条区块链,专门处理普通智能合约难以胜任的判定。传统智能合约擅长的是:每台机器做同样的计算都能得到同样的结果,比如判断钱到没到、期限过没过。麻烦出现在需要「读一段东西并理解它」的时候——也许是通读一份研究报告、看一个网页、读明白合同里的某一段,或者判断一张图是否符合创意要求。AI 模型的回答从不一致:面对同样的材料,它们的结论可能各不相同。于是「每个节点必须得出完全相同输出」的前提就站不住了。
GenLayer 有一个叫 Intelligent Contract 的东西。它不再要求每个验证者产出完全一样的文本,而是让多个验证者根据写进合约里的规则,判断某个提交的结果是否可接受。验证者在判断时可以使用大语言模型和公开的网络数据。

乍看之下,这像是智能体技术栈里又一块缺失的拼图。但已经有别的系统在做其中一部分工作,所以 GenLayer 并非从零起步。它更具体的角色是:当双方仍各执己见时,判定证据究竟意味着什么。
谷歌的智能体支付协议 AP2,已经能为「智能体被授权买什么、商家提供什么、哪笔支付获批」生成带密码学签名的记录。其规范明确写道,这些授权与收据日后可以作为争议中的证据。但 AP2 本身并不判定谁对谁错、钱该给谁——它只是保存一份可信的事件记录,把解读这份记录的过程留给别人。
以太坊针对智能体身份与声誉的标准 ERC-8004 也有一个验证注册表。智能体可以把工作提交上去,由另一个系统核验,核验结果随后可以上链、记入该智能体的履历。区块链能显示钱有没有动,所以支付类纠纷好办;当纠纷需要外部信息才能了结,就由预言机把信息带上链。可见有一块明确的空缺:证据摆在那里,总得有人判断它意味着什么,这正是 GenLayer 切入的地方。
为了看清真实的工作有多少落在各类里,我在 Slack 上的智能体(我盲目信任它,毕竟我们是一伙的)在 9 月 24 日抓取了 300 多条在线任务列表,来源包括 Freelancer.com、Fiverr、Upwork、Scale AI 旗下的 Outlier、Prolific,以及链上任务市场 Daydreams TaskMarket。我的智能体说,约 23% 的任务可以简单用「是/否」判定;另有 45% 主要依赖个人判断;剩下 32% 有证据可查,但仍需判断这份工作到底够不够好。

这不是一份市场规模估算,而且分类本身就出自 AI 的判断。但意思你明白了:并不是每一项涉及 AI 的任务,都需要一个 AI 法庭。
像「设计最漂亮的餐厅 logo」这样的任务,几位验证者也许都会同意某个设计比另一个更好看,但这种一致并不会把品味变成客观标准。除非买方事先写下了极详细的创意要求,争议的根源仍然是个人偏好。同理,一场营销活动可能达成了承诺的互动量,但围绕「这些互动有多少来自真实用户」依然会有分歧。这两种情况下都有证据可查,但在付款前都需要有人去解读。
加密行业在去中心化纠纷解决上已经试验多年,这些系统处理分歧的方式差别很大。
UMA 的乐观预言机先假定一个主张没问题,除非有人反对。提出主张的人要质押一笔保证金;若在等待期内无人挑战,答案就被接受;若有人挑战,则由 UMA 代币持有者投票裁决。这套机制把成本压得很低,因为多数主张无需完整审查即可通过,昂贵的投票只在有人挑战时才会启动。
Kleros 是建立在以太坊上的去中心化纠纷解决系统。它不靠公司雇员或法院裁决,而是随机抽取质押了其 PNK 代币的人担任陪审员。若一方上诉,下一轮会引入更多陪审员。这让 Kleros 适合那些真正需要人类判断的案子,但也意味着流程既慢又贵:普通法院一轮三名陪审员,费用约 0.015 ETH,还不含上诉;因此当争议本身只值几美元时,这套模式毫无意义。
GenLayer 把 Kleros 交给人类陪审员的裁决工作,交给了 AI 辅助的验证者。一个验证者提出答案,其他验证者来核查,若同意的人足够多,结果就走向最终确认;若有人挑战,会有一批新的验证者重新审理,争议继续升级时,参与人数还会增加。另外,UMA 和 Kleros 也都在向 AI 辅助裁决演进,所以我不会把 GenLayer 说成这两个「永远靠人」的系统的「AI 替代版」。

如果规则写得具体,验证者就有实打实的东西可查;如果合约只说这份工作应该「有洞见」或「有原创性」,那么几个模型彼此同意,也不会让这个标准变得更清晰。
GenLayer 用一个叫「等价原则」的机制来处理这一点:它告诉验证者,答案要相似到什么程度,网络才把它们视为同一个判定。有些合约可能要求完全一致;有些则允许验证者用不同措辞或推理,只要在关键结论上一致即可。GenLayer 的文档反复鼓励开发者把这类判定标准收窄。
这就把很大的权力交到了写合约的人手上:由他决定什么证据重要、什么算成功、答案之间的差异多大才可接受。GenLayer 能依据这些规则作出判断,但一旦争议开始,它无法把一个模糊的标准变得更清楚。
一份裁决只有在能真正改变交易时才有意义。在实践中,这意味着钱或其他有价值的结果必须与这一判定绑定起来。这样争议结束后,可以是资金被释放、被退回,或者某个智能体的声誉被更新。
对一笔小额的智能体交易来说,目标可能只是确保钱付给了正确的一方,而不是拿到一份具有法律强制执行力的判决。
那它到底在哪些地方真正有用?
智能体市场已经把「委托工作」和「支付」结合在一起,并越来越多地与链上身份挂钩,所以这显然是最值得看的方向之一。
以 Daydreams TaskMarket 为例,它跑在 Base 上,允许人类或 AI 智能体发布以 USDC 担保的任务。它不同的任务形式,恰好揭示了裁决在哪些地方有用、哪些地方没用。基准类任务可以让接单者围绕准确率、延迟这类可量化指标竞争;如果判据是明确的分数,比如一个智能体 96%、另一个 91%,平台直接核对数字、取更优结果即可。
但换成赏金任务,可能有好几个人提交不同类型的成果,需求方得判断哪个最好。这时如果没有简单的数字或规则告诉你谁做得更好,就必须有人去看成果、自己拿主意。
在软件与安全赏金里,要求某个智能体让一套固定测试用例全部通过的任务,可以机械地结算;而漏洞赏金则可能产生真正的分歧:这个漏洞算不算在范围内、严重程度描述得准不准,或者是否已经有人报告过同一个底层问题。
在效果营销里,数出 5 万次社交互动很容易,但这些是真实用户还是自动化账号?GenLayer 已经在展示 Rally,一个用其验证者分析社交活动、评估互动真实性的效果营销应用。
服务等级协议(SLA)本质上是服务商与客户之间关于最低服务水平的承诺。比如一家云服务商可能承诺 99.9% 的可用性,或在两小时内响应支持请求;若未能兑现,客户可能有权获得退款或服务抵扣。
如果协议已经明确规定了哪些日志、哪些监控服务、哪些例外情况算作证据,自动化裁决者要处理的事情就窄得多。
研究类任务是很好的例子,它能检验 GenLayer 在哪里好用、又在哪里触到天花板。研究工作的某些部分容易核查:报告有没有回答全部问题?信源是不是真的?验证者可以检查这些。
但像「这个洞见够不够原创」这样的问题就难得多,可能没有任何明确规则或证据能给出定论。
这类工作无法用简单的「是/否」脚本判定,但仍有足够的证据和结构,让不同的验证者得出一个合理的判断。如果任务几乎完全关乎品味或模糊的质量,系统可用到的东西就少得多。
如果你以为用好几名 AI 法官就能自动让裁决变得可靠,那并不成立。
如果五名验证者都用相似的模型,它们可能一起犯同一个错误:误解同一条指令、相信同一个坏信源,或者全都被操纵过的内容骗过。GenLayer 试图通过让验证者独立核查,并在有人上诉时引入新验证者,来降低这种风险。
证据本身也可能不可靠:网页会变,API 在不同时间会给出不同答案,文档里甚至可能藏有专门用来迷惑阅读它的 AI 的指令。所以只有当验证者能切实核查同一份证据时,系统才运转良好。有时可能压根就没有明确答案,这时 GenLayer 可以返回「无法判定」,而不必强行给一个是或否。
GenLayer 的设计倚仗孔多塞陪审团定理,即一群独立的推理者胜过任何单个个体。但这只有在推理者真正独立、且 AI 模型并非从重叠数据中学习时才成立。Kleros 的研究人员曾在一家拉美加密交易所的 99 起真实客户纠纷上做过近似测试:ChatGPT 5.5 有 3 起支持客户,Claude Opus 4.7 有 14 起。当他们用下一个版本的 Claude 重跑这些案子时,平台的胜率从 86% 升到了 95%。当模型的倾向是随机的,混合使用不同的模型会有帮助;但如果整整一代模型都朝同一个方向偏移,混合小组也会跟着偏。
这个市场现在有多大?很难估,因为只有一小部分智能体交易最终会变成纠纷。但现有的系统已经显示,对裁决的需求相当可观。
2025 年,商户处理了约 2.61 亿笔拒付,按每笔 128 美元计算,对应的纠纷处理规模约为 330 亿美元。而在另一端,GenLayer 目前每天大约产生 25,800 次测试网判定;即便按每次判定 1 美元算,一年也只有约 940 万美元。作为对比,eBay 巅峰时期每年处理约 6,000 万起纠纷,相当于每天约 16.4 万起。只有当机器商务最终把纠纷量做到这个级别时,GenLayer 才可能成为一门大生意。
要让这套机制成立,合约需要清晰的规则,证据需要可靠,验证者需要足够独立,使他们的「同意」真正有意义,上诉也要保持廉价。
人类商业已经有了法院、仲裁和纠纷处理团队,用来应对双方对同一笔交易各执己见。如果智能体之间开始做更多生意,它们可能需要一套更快、更便宜的同类机制——毕竟机器对任何东西,都想要一个便宜又快速的版本。
也许,在我们教机器做其他所有事情之前,先教它们如何判断什么是公平,是件好事。
| 感动 | 同情 | 无聊 | 愤怒 | 搞笑 | 难过 | 高兴 | 路过 |
相关文章
-
没有相关内容

会员登录