Pular para o conteúdo

Startup francesa promete 30x mais velocidade de inferência em GPUs convencionais

Kog inferencia GPUs otimizacao

Uma startup francesa está desafiando a ideia de que GPUs convencionais não são adequadas para inferência de IA em larga escala. A Kog, com sede em Paris, promete extrair até 30 vezes mais desempenho de inferência de LLMs em GPUs padrão de datacenter — como as AMD MI300X e Nvidia H200 — por meio de otimização de software em nível extremamente baixo.

Resultados que chamaram atenção

Em maio, a Kog ganhou a primeira página do Hacker News com uma demonstração que atingiu 3.000 tokens por segundo por requisição usando uma GPU convencional. O CEO Gaël Dellalleau revelou à TechCrunch que a empresa recebeu 200 leads de negócios concretos após a publicação do resultado.

O modelo utilizado na demonstração foi o Laneformer 2B, um modelo pequeno com cerca de 2 bilhões de parâmetros que foi posteriormente open sourced. A empresa agora trabalha para estender a abordagem a LLMs maiores, cujo tamanho representava um desafio para chips de inferência dedicados.

Mentalidade de hacking para acelerar GPUs

O fundador Dellalleau tem um background incomum: estudou física de estado sólido na École Polytechnique e depois trabalhou com cibersegurança ofensiva, sendo quatro vezes finalista no torneio CTF do DEFCON. Segundo ele, essa combinação moldou a abordagem da Kog.

“Do lado da ciência, há a mentalidade de entender as leis da física e as leis da GPU para aproveitá-las ao máximo”, explicou. “Do lado do hacking, aprender a fazer engenharia reversa em nível muito baixo — até linguagem de assembly e código binário — para entender como funciona e usar para um objetivo para o qual não foi necessariamente projetado.”

Desafio para LLMs maiores

O maior obstáculo da Kog é escalar a abordagem para modelos maiores. Dellalleau admitiu que os clientes potenciais não estão preparados para fazer fine-tuning de modelos pequenos, o que obriga a empresa a acelerar o desenvolvimento para LLMs maiores. “Quando implementarmos nosso primeiro modelo grande com velocidade 10x — o que deve acontecer em setembro — começaremos a demonstrar tração com clientes”, disse.

A empresa, que conta com 11 funcionários, precisa de semanas ou meses de pesquisa de engenharia de GPU para cada novo chip que adiciona. Isso limita o número de hardware que pode suportar no curto prazo, mas no longo prazo a Kog planeja usar pipelines baseados em agentes para expandir a compatibilidade.

Concorrência e soberania

A Kog não está sozinha nessa corrida. A ZML, também francesa, lançou software que ignora o CUDA da Nvidia para suportar inferência rápida em chips concorrentes. No entanto, Dellalleau afirma que a Kog está mais próxima do Hazy Research da Universidade Stanford, com foco ainda mais profundo na aceleração de GPU.

A startup é apoiada pela Scaleway e financiada pela Bpifrance e pelo programa French Tech 2030. Para mais notícias sobre inteligência artificial e startups, acompanhe Últimas Notícias.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *