K-Search 扩展 MLX 后端:将 CUDA 内核经验迁移至 Apple Silicon
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化式内核搜索框架,新增 MLX 后端与结构化 CUDA-to-MLX 翻译层,可将现有 CUDA 内核知识自动适配为 Apple Silicon 内核。
推荐理由:通过结构化 CUDA 到 MLX 翻译层,让演化式内核搜索在 Apple Silicon 上逼近专家级性能,为跨硬件内核迁移提供可复用路径。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化式内核搜索框架,新增 MLX 后端与结构化 CUDA-to-MLX 翻译层,可将现有 CUDA 内核知识自动适配为 Apple Silicon 内核。
推荐理由:通过结构化 CUDA 到 MLX 翻译层,让演化式内核搜索在 Apple Silicon 上逼近专家级性能,为跨硬件内核迁移提供可复用路径。
BAIR 提出 ABBEL 框架,将递归摘要的内容隔离为自然语言信念状态并周期性更新,使智能体仅以当前信念作为工作上下文。在 CollabBench 协作编码任务中,基于重建的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也低于全上下文设置。
推荐理由:该框架将摘要内容隔离为自然语言信念状态并加以监督,在协作编码任务中把与全上下文模型的差距缩小约一半。
UC Berkeley EPIC Data Lab 的 Aditya G. Parameswaran 等人发布观点文章,提出智能体时代数据系统面临面向智能体、承载智能体、由智能体构建三类新挑战。
推荐理由:从推理成本骤降出发,系统梳理智能体作为数据系统新负载带来的三类研究议题与工程改造方向。
伯克利人工智能研究实验室(BAIR)展示 2026 届博士毕业生,其研究覆盖机器人、LLM 与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for science 等方向。毕业生去向包括 OpenAI、Mistral AI、Physical Intelligence、Amazon 等机构,以及 UCLA、普林斯顿 CITP 等学术岗位,部分人正在创办初创公司。
BAIR 发布综述文章,系统梳理自适应并行推理(APR)这一范式,即让模型在推理时自行决定何时并行、开启多少线程以及如何协调。文章对比了 Multiverse、ThreadWeaver、Parallel-R1、NPR 等方法,指出 APR 相比 BoN 可避免冗余计算、相比 Tree-of-Thoughts 无需领域特定分解启发式,并给出以关键路径占比为核心的并行化奖励设计。
推荐理由:系统梳理自适应并行推理的推理系统设计与训练奖励方案,对比 Multiverse 与 ThreadWeaver 在 KV cache 聚合上的取舍。
BAIR 提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化,并对状态迭代注入高斯噪声以增强探索。在 Push-T 任务上,GRASP 在 H=80 时成功率达 10.4%、中位耗时 58.9s,优于 CEM、GD 与 LatCo 等基线。论文已发布于 arXiv(编号 2602.00475),可通过 arXiv 页面或项目网站获取全文与更多细节。
推荐理由:提出提升状态配点与动作梯度分离的规划器,在长时域 Push-T 任务上兼顾成功率与求解速度。
BAIR 发布 SPEX 与 ProxySPEX 算法,利用稀疏性与低阶性将交互发现重构为稀疏恢复问题,用于特征、数据与模型组件归因。ProxySPEX 借助层级结构以约 10 倍更少的消融次数达到 SPEX 同等效果,在 MMLU 高中美国历史任务上其剪枝策略还能提升目标任务表现。
推荐理由:SPEX 与 ProxySPEX 将交互归因从数十个组件扩展到数千个,ProxySPEX 以约 10 倍更少消融达到同等效果,代码已并入 SHAP-IQ。
BAIR 在 NeurIPS 2025 论文中提出基于互信息的成像系统评估与优化框架 IDEAL,仅用带噪测量和噪声模型即可量化测量对物体的区分能力。该方法在彩色摄影、射电天文、无透镜成像与显微成像四个领域验证了信息估计对解码性能的预测能力,IDEAL 优化出的滤色片设计在信息量与重建质量上匹配端到端优化,同时减少内存与算力开销且无需任务专用解码器。
推荐理由:该框架以互信息直接评估成像系统信息量,无需解码器即可预测下游任务表现并优化硬件参数。