产品动态·TechCrunch AI

法国初创 Kog 用更深层 GPU 优化提升推理速度

法国初创公司 Kog 宣称通过深度软件工程能在现有数据中心 GPU(如 AMD MI300X、NVIDIA H200)上显著提升单次请求的推理速度。创始人 Gaël Delalleau 展示了基于开源 Laneformer 2B 小模型的 demo,达到 3,000 每请求每秒(TPS),并计划将方法推广到更大模型以实现更高加速比。对开发者和企业用户而言,这意味着可能在不换硬件的前提下用软件优化降低延迟和成本,但 Kog 需要在大模型上复现成果以证明可行性。

Kog 在 Hacker News 发布技术预览,展示其在标准数据中心 GPU(示例包括 AMD MI300X 和 NVIDIA H200)上实现“极快的单次请求解码”能力。公司展示的 demo 使用的是开源的小模型 Laneformer 2B,达到了 3,000 每请求每秒(TPS)。该展示旨在证明通过深层次的软件与 GPU 工程,可以在现有硬件上挤出更多推理性能。

创始人兼 CEO Gaël Delalleau 表示,早期演示吸引了大量商业线索,公司收到约 200 个有实质意向的业务联系。Kog 认为首批落地场景会是软件工程工作流,目标客户多为对响应速度敏感、依赖 AI 完成专业任务的用户;公司也有希望用更快推理来提高营收的设计合作伙伴,例如用于生成游戏和应用的场景。

Kog 的方法强调对 GPU 的低层理解与优化,团队会为每一代新 GPU 投入数周或数月进行底层工程研究。这种做法限制了团队能同时支持的芯片数量;当前团队规模为 11 人。Delalleau 表示,他们计划把这种方法推广到更大的模型上,并预计在实现首个“10 倍加速”大模型后开始展示客户进展并寻求 A 轮融资。Kog 同时获得 Scaleway、Bpifrance 和 French Tech 2030 项目支持。

#Kog#GPU#推理优化

本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。

法国初创 Kog 用更深层 GPU 优化提升推理速度 - 一定会自由