KernelBand —— 让AI自己优化AI的性能引擎!

KernelBand —— 让AI自己优化AI的性能引擎!

ZHR

2026-06-23 发布10 浏览 · 0 点赞 · 0 收藏

KernelBand

  KernelBand —— 让AI自己优化AI的性能引擎!融合大模型生成能力与多臂老虎机算法,在庞大的GPU算子优化空间中智能探索,用更少的尝试找到更优解,大幅提升算力利用率,显著降低训练与推理成本。更快、更省、更聪明,KernelBand 正在重新定义 AI 性能优化的新范式!


  北京通明湖信息技术应用创新中心(简称“通明湖中心”)与北京大学、复旦大学等联合团队发布KernelBand 。KernelBand将GPU kernel优化转化为“硬件感知多臂老虎机”决策问题,在有限预算下更稳定地找到kernel的更快实现;在 TritonBench-G 上,KernelBand 在 RTX 4090、H20、A100 三种 GPU 架构上均取得稳定加速,代码已开源。


  如果说“大模型会写代码”已经逐渐成为共识,那么更尖锐的问题是:它能否写出“跑得快、跑得稳、跑得值”的系统级代码?尤其当目标从普通应用逻辑下沉到GPU kernel(算子核函数)时,“写对”与“写快”之间往往隔着一道巨大鸿沟。

  KernelBand 直指这一底层痛点:在大模型推理加速成为产业共识的当下,高性能 GPU kernel 是决定服务效率、成本与体验的“隐形底座”,但其优化长期依赖少数专家经验,投入大、门槛高且难以规模化。更麻烦的是,kernel 优化本质不是“把代码写对就结束”,而是一个在巨大、离散且高度硬件相关的空间中进行搜索与权衡的过程:不同 GPU 架构、不同算子形态、不同访存与并行模式都会改变“最优路径”。

  在这一背景下,KernelBand 团队选择了一种更工程化的技术定位:不把优化寄托在一次灵感生成或几轮主观反思上,而把它当作一个需要明确探索—利用(exploration–exploitation)权衡的决策问题。

  KernelBand 的关键判断可以概括为一句话:kernel 优化不是一次生成题,而是一场有预算约束的搜索博弈。

  在常见的“生成—运行—修错”范式里,我们默认优化空间能渐进爬坡。但 kernel 的性能地形巨大且不连续。LLM 擅长生成“更可能正确”的代码,却不擅长在硬件相关的性能地形里高效导航:要么探索不足陷入局部最优,要么探索过度导致成本飙升。

  KernelBand 的解法,是把“选择下一步该怎么改”形式化为多臂赌博机(Multi-Armed Bandit, MAB)问题:每次迭代都要在“尝试新策略”与“复用已验证有效策略”之间权衡,目标是在有限迭代预算内最大化性能收益。

第一 优化系统

  把 LLM-based kernel 优化系统化为(上下文)多臂赌博机问题 。论文将 kernel 优化视为在候选图上的迭代扩展:节点是正确 kernel,边是应用某种优化策略生成新实现;而决策核心是“在什么上下文下,对哪个候选应用哪个策略”。这种建模直接把优化过程的关键矛盾显式化:探索与利用的权衡。

第二 硬件感知裁剪

  用profiling上界把预算花在“可能有效”的方向 。KernelBand 不是盲目尝试策略,而是利用 profiling 得到的硬件瓶颈信息,为不同策略建立“收益上界/可行性”判断,从而屏蔽已经饱和资源上的无效策略,缩小有效动作空间。

第三 迹驱动聚类

  用行为相似性共享经验、提高样本效率 。KernelBand 通过运行时行为特征向量对候选 kernel 聚类,将 bandit 的“臂”从“无限候选×策略”压缩为“簇×策略”。利用运行时行为的 Lipschitz 连续性假设,让对一个簇的观测能迁移到相似 kernel,从而把后悔界(regret)与“运行时簇的覆盖复杂度”相关,而不是与巨大 kernel 空间直接线性相关。

请前往 登录/注册 即可发表您的看法…