Em 26 de abril de 2024, a O penAI divulgou os primeiros resultados dos testes com o Jalapeño, seu primeiro chip desenvolvido internamente para inferência de inteligência artificial, demonstrando avanços significativos em eficiência energética e velocidade de processamento frente a sistemas estabelecidos no mercado, especialmente à Nvidia.},.
Contexto Institucional e Antecedentes da Inovação Tecnológica
A O penAI apresentou, nesta quarta-feira (26), os primeiros resultados oficiais dos testes com o Jalapeño, chip desenvolvido exclusivamente para operação de inferência em modelos de grande porte, realizado no benchmark InferenceX da SemiAnalysis. O dispositivo superou sistemas da Nvidia em desempenho por watt — 1,5 vezes superior no Kimi K2.5 1T — e reduziu a latência total em 3,4 vezes, estabelecendo novo patamar de eficiência energética na indústria de IA. Esses indicadores apontam para uma arquitetura otimizada para cargas de trabalho específicas de resposta rápida, com ganho direto na escalabilidade sem necessidade de proporcionalidade no aumento de recursos físicos.
O s testes revelaram que o Jalapeño opera com potência máxima de até 700 watts, enquanto o consumo sustentado permaneceu abaixo de 550 watts nas cargas avaliadas, reforçando sua proposta de eficiência operacional. A empresa destacou que, embora mantenha parceria com fornecedores como a Nvidia para treinamento e inferência, pretende integrar o Jalapeño à sua infraestrutura global até o final de 2026, sinalizando uma estratégia de consolidação tecnológica independente.
O Jalapeño alcançou 1,5 vezes mais desempenho por watt e latência 3,4 vezes menor que os sistemas da Nvidia em testes com o modelo Kimi K2.5 1T.
Repercussão Técnica e Estratégia Corporativa
A O penAI afirmou que continuará utilizando aceleradores da Nvidia e de outros parceiros no treinamento e na inferência atuais, mas vê no Jalapeño um componente estratégico para expandir sua capacidade de resposta sem proporcionalidade ao custo energético e físico. A integração do chip à infraestrutura própria visa reduzir a dependência externa e otimizar custos operacionais em escala global.
Com prazo definido para adoção total até 2026, a empresa projeta que o ganho de eficiência no processamento de requisições de IA permitirá maior expansão de serviços e produtos baseados em modelos generativos, sem exponencialmente aumentar investimentos em hardware.



