研究:AI 在记账任务上速度与准确率超过持证会计师,但仍无法独立完成结账
Mercor 让 12 名平均从业五年半的持证 CPA 与 AI 模型完成 APEX Accounting Benchmark 的简化任务,18 个月前最好的模型得分还低于会计师约 37% 的平均水平,如今已近乎全对。
Mercor 让 12 名平均从业五年半的持证 CPA 与 AI 模型完成 APEX Accounting Benchmark 的简化任务,18 个月前最好的模型得分还低于会计师约 37% 的平均水平,如今已近乎全对。
MIT 的 Alex Zhang 在 Latent Space 播客中讲述其从 GPU kernel、KernelBench 到递归语言模型(RLM)的研究路径,RLM 驱动的 harness 曾率先接近解决 ARC-AGI-3。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化式内核搜索框架,新增 MLX 后端与结构化 CUDA-to-MLX 翻译层,可将现有 CUDA 内核知识自动适配为 Apple Silicon 内核。
推荐理由:通过结构化 CUDA 到 MLX 翻译层,让演化式内核搜索在 Apple Silicon 上逼近专家级性能,为跨硬件内核迁移提供可复用路径。
BAIR 提出 ABBEL 框架,将递归摘要的内容隔离为自然语言信念状态并周期性更新,使智能体仅以当前信念作为工作上下文。在 CollabBench 协作编码任务中,基于重建的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也低于全上下文设置。
推荐理由:该框架将摘要内容隔离为自然语言信念状态并加以监督,在协作编码任务中把与全上下文模型的差距缩小约一半。
UC Berkeley EPIC Data Lab 的 Aditya G. Parameswaran 等人发布观点文章,提出智能体时代数据系统面临面向智能体、承载智能体、由智能体构建三类新挑战。
推荐理由:从推理成本骤降出发,系统梳理智能体作为数据系统新负载带来的三类研究议题与工程改造方向。
BAIR 发布 SPEX 与 ProxySPEX 算法,利用稀疏性与低阶性将交互发现重构为稀疏恢复问题,用于特征、数据与模型组件归因。ProxySPEX 借助层级结构以约 10 倍更少的消融次数达到 SPEX 同等效果,在 MMLU 高中美国历史任务上其剪枝策略还能提升目标任务表现。
推荐理由:SPEX 与 ProxySPEX 将交互归因从数十个组件扩展到数千个,ProxySPEX 以约 10 倍更少消融达到同等效果,代码已并入 SHAP-IQ。