Kog想用软件提升GPU推理

TechCrunch AI··作者 Anna Heim

关键信息

Kog最引人注目的说法是“LLM推理快30倍”,但文中提到的演示是在一个专门构建的20亿参数模型Laneformer 2B上达到每请求3,000个token/秒,而不是大型生产级LLM。首席执行官Gaël Delalleau表示,公司现在正把重点放到更大模型上,并认为新一代GPU拥有足够的内存带宽,可以通过软件释放解码瓶颈。

资讯摘要

AI推理竞赛正在升温,Cerebras在5月以专用芯片上市时也获得了市场的积极反应。与之不同,法国初创公司Kog认为,标准数据中心GPU仍然有大量未被挖掘的性能空间。Kog在5月曾因为一项技术预览登上Hacker News首页,预览主张企业现有的GPU就可以实现“极快的单请求解码”。当时演示使用的是AMD MI300X和Nvidia H200,这也让一些人指出它并不适用于笔记本电脑GPU。不过,这个演示仍然引发了关注,因为推理速度和成本如今已经成为AI系统的重要瓶颈。首席执行官Gaël Delalleau表示,这次曝光带来了大约200个有实质性的商业线索。根据早期客户反馈,Kog认为软件工程会是最先落地的场景,尤其适合像Claude Code这样的工具,因为用户愿意为更快的返回结果付费。

公司还有一些设计合作伙伴,他们通过提示词生成游戏和应用,而更快的响应可以直接带来更多收入。Kog也承认市场还不成熟,并表示客户目前还不准备对小模型做微调,因此公司在发布后转而专注于加速更大的模型。它最激进的说法是“LLM推理快30倍”,但文章中提到的公开演示只是在Laneformer 2B上实现了每请求3,000个token/秒,这是一款大约20亿参数、专门构建的模型,而且已经开源。Delalleau认为同样的方法也能用于LLM,并否认GPU不适合解码的说法。他还指出,新一代GPU的内存带宽越来越高,关键在于通过软件把这些能力释放出来。Kog表示,这种路线需要对每一代新GPU进行大量手工深挖,往往要花上数周甚至数月来研究硬件细节。

Kog想用软件提升GPU推理

资讯正文

更快的 AI 推理竞赛已经打响,而市场也在 Kog 上市首秀于 5 月时对 Cerebras 及其专用芯片报以热烈欢迎。不过,法国初创公司 Kog 押注,传统 GPU 里还有更多性能可以被榨出来。

这家公司在 5 月登上了 Hacker News 首页,发布了一份技术预览,旨在证明“在企业已经拥有的标准数据中心 GPU 上,实现极快的单次请求解码是可行的”——它的演示使用了 AMD MI300X 和 Nvidia H200 GPU。

有些人失望地得知,这并不适用于我们笔记本电脑里的 GPU,但也有人看到了潜力。随着推理速度和成本如今已成为关键瓶颈,Kog 承诺通过软件优化在现有硬件上解锁新能力,这吸引来的不只是旁观者。CEO Gaël Delalleau 告诉 TechCrunch:“我们收到了 200 个实打实的商业线索。”

根据早期反馈,这位独立创始人预计软件工程将是首个应用场景。资深 Claude Code 用户都知道,他们有时得等上几个小时才能拿到结果。Anthropic 自己也明白速度值钱,因此对 Claude 的 Fast Mode 收取了更高的价格。

Kog 希望瞄准那些被这些延迟劝退的客户,通常是因为他们在专业任务中依赖 AI 工作流。Delalleau 说,但这家初创公司也有一些设计合作伙伴,允许用户通过提示词生成游戏和应用,而借助 Kog Inference Engine(KIE)更快拿到结果,就意味着更高的收入。

公司也意识到,这个市场还远未成熟。在观察需求的过程中,Kog 发现其潜在客户还没有准备好对小模型进行微调。“这也是为什么自从发布以来,我们就完全专注于加速更大模型的开发,以满足我们看到的需求。”

这意味着,Kog 要兑现“LLM 推理速度快 30 倍”的承诺,还有很长的路要走。它的演示显示,每个请求可达到令人印象深刻的 3000 tokens per second(TPS)——但那是借助一个专门打造的小模型,仅约 20 亿参数,即如今已开源的 Laneformer 2B。

尽管质疑者不以为然,Delalleau 仍坚信同样的方法同样适用于 LLM,而模型规模正是推理芯片面临的挑战之一。“GPU 有着光明的未来,”他说。对 Kog 的 CEO 而言,GPU 并不适合解码这一观点,已经成了一种误解;新一代 GPU 拥有越来越大的内存带宽,只等着被释放出来。

并非只有 Kog 认为,软件优化可以帮助 GPU 做到远超其表面规格所示的事情。另一家来自法国的公司 ZML 发布了与硬件无关的软件,绕过 Nvidia 的 CUDA,以支持在竞争芯片上的高速推理。但 Delalleau 说,Kog 更像是斯坦福大学实验室 Hazy Research,只不过它对 GPU 加速的关注更深入一层。

Delalleau 本人并不是研究人员,而他的第一家创业公司、TechCrunch50 2009 年参展项目 Stribe,与他的这家新公司并没有关系——除了他的前联合创始人、如今已转做风投的 Kamel Zeroual 之外;由 Zeroual 所在的 Varsity VC 与另一家机构共同领投了 Kog 的种子轮。不过,这家初创公司对底层技术的深入聚焦,源自他独特的背景。

在法国巴黎综合理工学院学习固态物理之后,他转而从事进攻性网络安全工作——也就是所谓的白帽黑客。Delalleau 表示,这塑造了他如今鼓励团队采用的思维方式。在科学层面,“要有这样一种思维:理解物理定律,以及 GPU 的运行规律,从而尽可能把它们发挥到极致。”

至于黑客技术,这位四次入围 DEFCON CTF 比赛决赛的选手表示,它教会了他“从非常底层去逆向工程事物——一直到汇编语言和二进制代码——去理解它是如何运作的,并尝试把它用于实现一个原本未必就是为此而设计的目标。”

这种方法的缺点是非常依赖人工,而且耗时。“对于每一款新的 GPU,我们都会投入数周甚至数月时间,真正深入细节,对那块硬件开展 GPU 工程研究。”对于一个只有 11 人的团队来说,这限制了 Kog 能够合作处理的芯片数量,至少在可预见的未来是如此。

从长远来看,Kog 希望把自己的方法论融入基于智能体的流水线中,这样就能支持更多芯片和模型。随着欧洲试图在这两个方面建立自己的能力,这或许会为这家初创公司带来更多“主权”层面的顺风因素;Kog 已经获得 Scaleway 的支持,并得到法国 Bpifrance 以及 French Tech 2030 计划的资助。

不过目前,Kog 需要向世界证明,它的方法在 LLM 上确实有效。这对于争取更多融资也至关重要。Delalleau 说:“一旦我们实现首个大型模型 10 倍速度的优化,我认为这会在 9 月完成,我们就能够开始展示客户采用的迹象,然后据此去募集 A 轮融资。”

来源与参考

  1. 原始链接
  2. Kog is going deeper to squeeze more inference out of GPUs | TechCrunch

收录于 2026-08-15