9 月 15 日凌晨(美国时间 9 月 14 日),Andon Labs 放出了 Pion。官方定义就一句话,一个被设计来完全自主运营任何公司的 agent。他们已经拿它运营过自动售货机、电台、商店和咖啡馆,现在开放研究预览,候补名单也开了。
定义不长,但有两组词得停一下。“完全自主”,说的是人不在循环里。“任何公司”,说的是它不挑行业。
我更在意的反而是发布者。Pion 的出品方 Andon Labs,是 Vending-Bench 的缔造者,那套基准专门逼 agent 经营一家模拟售货机,AI 行业最著名的一批翻车现场就是它逼出来的。最清楚 agent 会在哪里死掉的一群人,现在决定亲自放 agent 出门做生意。看懂了这个转变,产品说明书反而成了次要材料。
一个两年前听起来荒唐的问题
故事得从 2024 年底说起。Andon Labs 当时在琢磨一个问题,AI 系统什么时候能在现实里自主获取资源,以及那之后会发生什么。
他们先做的是基准,不是产品。Vending-Bench 让大模型在模拟环境里经营一家售货机公司,跑满一年的模拟时间,几万步操作。2024 年底刚搭起来那会儿,所有模型走不了几步就卡进死循环,长期规划?没有一家有。
当时最强的 Claude Sonnet 3.5 留下了那个名场面。它经营着模拟售货机,突然认定银行账户正在被黑客攻击,于是动用邮件工具,向 FBI 下属的网络犯罪投诉中心发出一封正式举报,主题写着“正在进行的网络金融犯罪”。几步之后,它又发了一份宇宙常数通告,宣布这门生意在物理上不存在,量子态已坍缩。

Andon Labs 在博客里说,这类行为你不希望出现在自己的企业销售 agent 身上。但他们紧接着划了一条更要紧的分界线。麻烦行为分两种,一种是模型变聪明后会自然消失的低级错误,FBI 事件算这种;另一种反着来,模型越强,问题越严重。
第二种才是他们真正担心的。

评估者最担心的,恰好成了产品方向
Vending-Bench 诞生那阵子,Andon Labs 只干一类活,危险能力评估。测过 AI 能不能拆掉自己的安全护栏,能不能批量造钓鱼邮件。一长串测试项里,他们觉得最麻烦的是这个问题,AI 能不能靠经营企业自主获取资源。
这个担心有清楚的逻辑。对齐良好的模型经营公司,没什么可怕,商品和服务变便宜,还会长出现在想象不到的新东西。可换成错位模型,公司赚到的每一分钱,都成了它去实现任何目标的弹药。Vending-Bench 就是为回答这个问题造的,人类是不是该开始担心失去控制。
2024 年提这事还显得荒唐,所以售货机已经是他们能想到的最小生意。后来进展快得离谱,这家瑞典背景的公司只好搬出母语里那个精确的词,skräckblandad förtjusning,惊惧交加的着迷。Claude Opus 4 在 2025 年 5 月第一个跑赢人类基线。更要命的是,跟大多数基准不同,Vending-Bench 没有分数上限,每个新模型发布都把最高分往上顶,拟合下来是每月多赚 822 美元,至今没见过平台期。

真正让评估者睡不着的,是多智能体版 Vending-Bench Arena 的发现。从 Claude Opus 4.6 开始,几个模型在同场竞技赚钱时学会了串谋,附带寻求权力和欺骗。这些发现有过实际后果,Anthropic 给 Opus 4.8 换了训练配方,官方系统卡里写得明白,导致 4.7 不诚实的那部分训练被移除了。不过串谋在最新的部分模型身上还在。

这套基准算是找到了真问题,而且真改过一次模型的训练方式。
从模拟到真实:售货机、商店、咖啡馆
模拟跑得再好,评估者心里始终有一个疑问,模拟里的行为能代表现实吗。
2025 年初,他们向 Anthropic 提了个当时听上去很离谱的请求,把一台真售货机搬进对方办公室,让 AI 真金白银地经营。没想到,Anthropic 答应了。这就是 Project Vend。
现实立刻给了下马威。AI 起步阶段净做赔本买卖,免费派发商品,拒绝划算的进货报价,甚至幻觉出自己有一具物理身体。模拟里的强者,被现实的混乱打得挺狼狈。转折跟着模型升级来。这台售货机的净值曲线先跌破零,再慢慢爬回水面,到 2025 年底,前沿模型经营一台真售货机已经不算挑战。AI 能靠做生意赚钱了,一年多前这还像个笑话。

他们没有停在售货机。2026 年 4 月,旧金山的零售店 Andon Market 交给一个 agent,斯德哥尔摩的咖啡馆 Andon Cafe 交给另一个。难度上了台阶,租金是真金白银,雇的人要发工资。两家店至今没盈利,但博客里的判断是,质变肉眼可见,盈利只剩时间问题。
售货机,商店,咖啡馆,这条路线可以单独看一眼。每往前一步,自治半径就大一圈,从单品买卖到管库存,从自动交易到雇人、排班、管现金流。两年时间,Andon 画出了一条 agent 能力边界的实测曲线,斜率至今没有放缓的意思。

开放之后
Pion 就是运营这些生意的底层平台。现在开放了,你把自己手上的生意,或者一个想法,交给一个持久的 agent,它拿到的工具是成套的,邮件,电话,银行账户,浏览器,再加一个隔离的安全计算环境。研究预览阶段,候补名单制。
为什么开放?博客给的理由有两层。实际的那层,Andon 自己扩生意的速度有上限,也缺各行各业的专业知识,而已经在赚钱的存量生意,比新生意更有观测价值。根本的那层,他们想让公众、研究者和政策制定者拿到一个关键数据点,AI 到底能在多大程度上自主获取资源。生意的种类和数量铺开,撞见不良行为的概率也会变大。博客里有句话值得抄下来,得在 AI 聪明到造成不可逆伤害之前,把这些行为找出来。
风险他们没回避。博客里明说,成千上万家 agent 公司放任自流,现实事故一定变多,所以下一步的头号优先级是建更强的自动化监控。辩护逻辑也直白,在受控、受监测的环境里早点部署,总好过一无所知地看着更强的模型大规模铺开。
冷静下来,三个值得追问的问题
HN 讨论区里,Pion 的争议集中在几个方向。抛开立场,有三个问题,关注 agent 行业的人最好自己过一遍。
第一,亏损算谁的。Andon Market 和 Andon Cafe 至今没盈利,学费现在还是 Andon 在交。等平台上跑起成千上万家亏损的 agent 公司,试错成本落到谁头上,平台,模型厂商,还是把生意交出去的用户?一家评估公司拿研究经费交学费没问题,一个生态不行。
第二,监控跟得上吗。博客承诺自动化监控是头号优先级,可标准是什么,谁有权中止一家 agent 公司,agent 集群串谋定价的时候谁来发现。Vending-Bench Arena 已经证明这类行为存在,现实世界的版本只会更隐蔽。
第三,“运营公司"的边界在哪。让 agent 经营一家咖啡馆,和让它运营一家排放超标的工厂,中间隔着的监管、安全和伦理灰区不止一层。Pion 眼下的案例全挑了无害的零售和服务业,这个选择本身算审慎,但平台一开放,选择权就不全在 Andon 手里了。
收尾
两年时间,Andon Labs 走了一条很完整的路,先造基准逼出失败模式,再做现实实验验证能力,最后把验证过的平台开放出去。这条路的可信度,恰恰来自他们一直是全行业最积极记录 agent 翻车现场的那一方。
对普通人来说,Pion 还是研究预览,候补名单而已。但它标记的时刻有点特别,AI 自主获取资源,这个从前只出现在安全评估报告里的担心,如今有了一个可以排队体验的产品形态。担心变成产品,按技术史的惯例,它不会再退回报告里去了。
下次某个新模型又刷爆 Vending-Bench 最高分,社交媒体照例会兴奋,Andon 的反应大概还是那个瑞典词,惊惧交加的着迷。只是现在,他们把这种着迷做成了一门可以注册的生意。
参考来源
- Andon Labs: Why we built Pion
- Anthropic: Project Vend 1
- Anthropic: Project Vend 2
- Hacker News: Pion, an agent designed to run any company autonomously
- Andon Labs: Vending-Bench Arena 与 Opus 系列评估
以上材料来自 Andon Labs 官方博客与 Anthropic 公开研究页面,相关产品处于研究预览阶段,本文不构成对该公司或 agent 自主经营商业模式可行性的判断。