跳到正文

#推理优化

今日 0 条
10月2日周五
7月29日周三
  1. Berkeley AI Research (BAIR)71

    K-Search 扩展 MLX 后端:将 CUDA 内核经验迁移至 Apple Silicon

    IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化式内核搜索框架,新增 MLX 后端与结构化 CUDA-to-MLX 翻译层,可将现有 CUDA 内核知识自动适配为 Apple Silicon 内核。

    推荐理由:通过结构化 CUDA 到 MLX 翻译层,让演化式内核搜索在 Apple Silicon 上逼近专家级性能,为跨硬件内核迁移提供可复用路径。

5月8日周五
  1. Berkeley AI Research (BAIR)62

    BAIR 综述自适应并行推理:从固定并行到模型自主控制流

    BAIR 发布综述文章,系统梳理自适应并行推理(APR)这一范式,即让模型在推理时自行决定何时并行、开启多少线程以及如何协调。文章对比了 Multiverse、ThreadWeaver、Parallel-R1、NPR 等方法,指出 APR 相比 BoN 可避免冗余计算、相比 Tree-of-Thoughts 无需领域特定分解启发式,并给出以关键路径占比为核心的并行化奖励设计。

    推荐理由:系统梳理自适应并行推理的推理系统设计与训练奖励方案,对比 Multiverse 与 ThreadWeaver 在 KV cache 聚合上的取舍。