Apodex 1.1 在开源 35B 权重之外,还开源了多 Agent 执行框架 FrontierAgent,采用 Apache 2.0 协议、不绑定自家模型,任何 OpenAI 兼容 endpoint 都能接,Agent runtime、终端 TUI、任务看板、文件沙箱、修改审批、回滚与评测套件一并放出。
发现好多人盯着 Apodex 1.1 的 35B 开源权重流口水,
我反而觉得这次最值钱的是跟着一起开源的 FrontierAgent。
模型决定想法,harness 才决定它能不能把活干完,
先给大家一个判断标准,手头的活满足任意三条,就别在聊天窗口硬扛了:
要查多个来源、要读一堆本地文件、能拆成多个独立分支、跑一半可能改需求、要跑 shell 改文件、最后要交付报告 / CSV / 代码这类真实文件。
就问个问题、润色一段话、总结一篇文章这种小活,普通聊天工具更省事。
有 5 类烂活,扔给它特别合适:
1️⃣多源调研、竞品分析、尽调
以前查个选型要开几十个网页,来源互相矛盾,查完还要自己整理对比。开 Agent Team 拆给子 agent 分头查市场、价格、案例、风险,最后给你带来源的报告、对比 CSV、风险反例,不是简单拼摘要。
2️⃣一文件夹资料变成可交付物
PDF、CSV、代码、图片散在各处,聊天窗口传到后面就丢上下文,最后只给你一段文字。它把文件分成只读输入区、工作区、输出区,原始文件不会动,最后给你清洗好的表、核查报告、来源索引,都是能直接用的文件。
跑一半经常改需求的长任务
最烦调研到一半加新文件、改预算,以前全得重跑。它跑的时候你直接输新要求,会在安全节点注入,已经跑完的有效结果全保留,只重算受影响的部分,还能断点续跑。我之前跑 AI 副业调研,8 个 agent 跑一半砍预算加约束,就是这么处理的。
3️⃣代码仓库调查和受控修复
让 AI 改代码最怕它乱改无关文件、留脏状态、改了什么说不清。所有修改先给你看 diff,审批了才生效,有 checkpoint 能回滚,改完给你测试结果和变更说明,不会把你仓库搞炸。
4️⃣批量评测模型和工作流
跑 benchmark 最烦搭环境、跑一半断了、失败样本不好重跑。它内置评测套件,并发执行、失败项单独重跑、产物自动收集,BrowseComp、HLE 这些主流 benchmark 都现成支持。
5️⃣别什么任务都开 Agent Team,这是很多人容易踩的坑。
单条主线、文件分析、代码调查这种聚焦的活,用 ReAct 模式就行,省 token 效率高;范围宽、能拆成多个独立分支、需要交叉验证证据的,再开 Agent Team。并行是有成本的,小任务没必要。
这次开源是挺实在的,Apache 2.0 协议,不绑定 Apodex 自家模型,任何 OpenAI 兼容的 endpoint 都能接。Agent runtime、终端 TUI、任务看板、文件沙箱、修改审批、回滚、评测套件全给你了,不是只放个权重就完事。
也说清楚边界:框架是跑在本地的,但 35B 模型要本地离线跑还是得有合适的 NVIDIA GPU,普通笔记本别想;连云端 API 的时候数据该走还是走,不是用了本地框架就 100% 离线。
天天被查资料、整文件、改代码这些破活耗时间的,真可以去试试,比在聊天窗口里反复传文件效率高不少。
wow,刚发布的 Apodex 1.1 把一整套开箱即用的多 Agent 架构(35B 权重 + 单机 harness)全开源了,支持本地单机部署!!! 大家都在看它跑分,我直接拿它做了一次AI副业赚钱项目真实长任务实测: 2000 块启动资金、每周 15 小时、零粉丝不会编程,普通人做什么 AI 副业最值得先试? 结果它跑出来的第一个核心结论,直接把网上的暴富营销滤镜给砸碎了。 8 个 Agent 并行跑了几十步,最后在公开采样范围内,满足 A 级证据标准的个人收入成功案例是 0。 这大概是我见过最不给暴富营销留面子的 Agent 跑测了,不是说现实里真没人赚钱,而是抓到的那些月入几万的故事,大多只有单人自述或单张收入截图,缺少完整成本、投入周期、既有资源和失败样本,根本撑不起普通人照做就能成的承诺。 但比这个打脸结论更狠的,是它跑任务的过程: 整个界面右侧的任务看板一直在实时更新,它不是丢给你一个转圈的黑盒页面,你能清楚看到后台有 8 个专业 Agent 并行在跑,谁在负责反方证伪(income_skeptic)、谁在核算成本(cost_analyst)、谁在抓需求(demand_scout)。 任务初始条件其实是 2000 块启动,跑了一半,1 个 Agent 已经完成、另外 7 个还在深度检索,我临时插了一句话:把预算砍到 1000,追加零粉丝、无品牌、不会编程,并排除卖课和泛流量。 换成普通 Agent 早就崩溃或者推倒重来了,但它在看板里立刻列出影响分析,把依然成立的需求和反例证据保留下来,只针对成本、获客和排序做了局部重算,原来的证据分支继续往下推进。 更硬核的是交付前的独立审查(Statement Review)。 生成和审查完全物理隔离,另一组审查 Agent 主动推翻了原稿里文案需求居首的断言,指出视频剪辑需求实际上最多,把简历优化移出了独立候选,还主动指出了 40 条样本里 90% 来自英文平台的局限性以及免费工具的商用授权风险。 经过两轮回归复核,所有问题全部修复才最终放行。 最后交付的不仅是一份报告,而是带有证据清单、验证优先级表、30 天去留标准、需求样本和业务模板等一整套可以直接落地的执行文件。 留下的是文案/脚本、PPT/办公文档、口播短视频剪辑、垂直头像/插画这几类需求明确、交付边界清楚的小单服务。 但必须把边界说明白:这是 30 天验证优先级,不是赚钱榜;30 天是验证周期,不是回本承诺。 这次最让我意外的,是他们不仅做了 Web 工作台,还把整套多 Agent 执行框架直接开源了——命令行框架 FrontierAgent 已经放上 GitHub,连带可本地跑的 35B mini 模型权重也同步上了 Hugging Face。 不想依赖云端、不想上传敏感数据的,macOS/Linux 一行命令就能在本地把这套多 Agent 跑起来。 跑完这一圈,我真正关心的早就不只是模型能不能吐出一个漂亮答案了。 在真实世界里,需求随时会变、证据经常打架、计算和引用也难免出错——它能让你全程看清进度,保留已经做对的结果,局部打补丁,还能拉着独立审查去反复挑刺,把能直接拿去用的文件稳稳交到你手里。 比起只会写报告的 AI,这种在混乱和变化中把任务真正做完的交付力,才是我理解里成熟的 Agent 能力单位啊。在 X 查看被引用的帖子
来源:@AYi_AInotes · x.com