研究:AI 在记账任务上速度与准确率超过持证会计师,但仍无法独立完成结账
Mercor 让 12 名平均从业五年半的持证 CPA 与 AI 模型完成 APEX Accounting Benchmark 的简化任务,18 个月前最好的模型得分还低于会计师约 37% 的平均水平,如今已近乎全对。
Mercor 让 12 名平均从业五年半的持证 CPA 与 AI 模型完成 APEX Accounting Benchmark 的简化任务,18 个月前最好的模型得分还低于会计师约 37% 的平均水平,如今已近乎全对。
BAIR 提出 ABBEL 框架,将递归摘要的内容隔离为自然语言信念状态并周期性更新,使智能体仅以当前信念作为工作上下文。在 CollabBench 协作编码任务中,基于重建的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也低于全上下文设置。
推荐理由:该框架将摘要内容隔离为自然语言信念状态并加以监督,在协作编码任务中把与全上下文模型的差距缩小约一半。
BAIR 发布综述文章,系统梳理自适应并行推理(APR)这一范式,即让模型在推理时自行决定何时并行、开启多少线程以及如何协调。文章对比了 Multiverse、ThreadWeaver、Parallel-R1、NPR 等方法,指出 APR 相比 BoN 可避免冗余计算、相比 Tree-of-Thoughts 无需领域特定分解启发式,并给出以关键路径占比为核心的并行化奖励设计。
推荐理由:系统梳理自适应并行推理的推理系统设计与训练奖励方案,对比 Multiverse 与 ThreadWeaver 在 KV cache 聚合上的取舍。
BAIR 发布 SPEX 与 ProxySPEX 算法,利用稀疏性与低阶性将交互发现重构为稀疏恢复问题,用于特征、数据与模型组件归因。ProxySPEX 借助层级结构以约 10 倍更少的消融次数达到 SPEX 同等效果,在 MMLU 高中美国历史任务上其剪枝策略还能提升目标任务表现。
推荐理由:SPEX 与 ProxySPEX 将交互归因从数十个组件扩展到数千个,ProxySPEX 以约 10 倍更少消融达到同等效果,代码已并入 SHAP-IQ。