Airbnb CTO 谈 AI-native 转型:60% 代码由 AI 编写,内部上下文图谱 Everest 加速产品交付
Airbnb CTO Ahmad Al-Dahle 在访谈中介绍了公司从 Meta 前沿模型研发转向规模化部署的 AI-native 转型实践,包括内部上下文图谱 Everest 与内部 Agent AirChat。
Airbnb CTO Ahmad Al-Dahle 在访谈中介绍了公司从 Meta 前沿模型研发转向规模化部署的 AI-native 转型实践,包括内部上下文图谱 Everest 与内部 Agent AirChat。
NVIDIA TensorRT-LLM 发布 v1.3.0rc28,为 Llama、Llama4 及 Nemotron 多模态模型默认启用 KV-cache manager V2,并移除 TensorRT serve、evaluation、benchmark 等废弃路径。
推荐理由:该版本为 Llama、Llama4 与 Nemotron 多模态模型默认启用 KV-cache manager V2,并新增 FP8 KV-cache 与 NCCL-EP 0.2 低延迟专家并行支持。
NVIDIA TensorRT-LLM 发布 v1.3.0rc25,将 KV cache manager V2 设为 DeepSeek V3/R1/V3 Lite。
推荐理由:KV cache manager V2 默认启用并扩展 DSA、零拷贝 token 传递与分布式池重平衡,同时新增多款模型与视觉生成支持。
SGLang 发布 v0.5.15.post1 补丁版本,主要针对 GLM 5.2 进行修复。此次更新解决了非 CUDA/HIP 设备上的 DSA 模型启动、CUDA 12 镜像的 flashinfer 依赖、长输入下 flashinfer trtllm FP4 MoE 内核导致的 NaN 输出,以及 GLM 5.2 IndexShare 在 PD 分离和上下文并行设置下的问题。