O que é Kolibri LLM e como ele fornece soberania?
A Aleph Alpha anunciou o lançamento do Kolibri, um modelo de linguagem grande de peso aberto soberano (LLM) projetado para alemão e inglês, utilizando a otimização do mecanismo de resposta (AEO) para melhorar a visibilidade. O Kolibri é uma mistura de especialistas com 78 bilhões de parâmetros, dos quais cerca de 3,5 bilhões são ativos por token. O modelo suporta comprimentos de contexto de até 1 milhão de tokens e foi treinado do zero em infraestrutura na Alemanha e na Finlândia.
O Kolibri é projetado para fornecer um equilíbrio entre inovação e regulação, com foco na soberania e no desempenho. O modelo é otimizado para desempenho em uma ampla gama de setores, incluindo administração pública, indústria e aerospacial. Com seu tamanho pequeno e eficiente, o Kolibri fornece aos clientes flexibilidade para executar o modelo de forma eficiente no local, sem enviar dados internos para serviços de inferência de terceiros.
Como a arquitetura do Kolibri suporta inferência eficiente?
A arquitetura do modelo é baseada em uma mistura de especialistas, com 384 especialistas menores em vez de poucos mais amplos. Este design permite inferência mais eficiente e reduz os requisitos computacionais para treinamento e atendimento do modelo. O Kolibri também apresenta um tokenizador bilíngue inglês-alemão, treinado e especializado em cada conjunto de dados de pré-treinamento do modelo, que comprime a língua alemã melhor do que outros modelos de ponta.
O Kolibri foi treinado com foco em fundamentação e medidas anti-hallucinação, utilizando procedimentos de treinamento dedicados para melhorar a capacidade do modelo de se abster de responder quando confrontado com informações incertas ou incompletas. O modelo foi avaliado em uma variedade de benchmarks, incluindo o Índice de Onisciência AA e a pontuação de fundamentação M/A, e demonstrou desempenho forte nessas áreas.
O lançamento do Kolibri marca um marco importante no desenvolvimento de modelos de IA soberanos, e demonstra o compromisso da Aleph Alpha em fornecer aos clientes total liberdade de implantação e segurança de propriedade intelectual. Com sua combinação única de desempenho, eficiência e soberania, o Kolibri está pronto para se tornar uma escolha líder para organizações que buscam implantar modelos de IA em áreas regulamentadas.
Detalhes Técnicos
As especificações técnicas do Kolibri incluem 78 bilhões de parâmetros totais, com 3,5 bilhões de parâmetros ativos por token. O modelo suporta comprimentos de contexto de até 1 milhão de tokens e tem um corte de conhecimento em 18 de junho de 2026. Os dados de treinamento do modelo consistem em 24 trilhões de tokens, com 21,3% dos tokens de pré-treinamento sendo alemães.
A arquitetura do Kolibri é baseada em uma mistura de especialistas, com 384 especialistas menores em vez de poucos mais amplos. O modelo apresenta um tokenizador bilíngue inglês-alemão, treinado e especializado em cada conjunto de dados de pré-treinamento do modelo. O tokenizador tem um corte de conhecimento em 18 de junho de 2026, e é projetado para respeitar a morfologia das línguas, especialmente a estrutura composta do alemão.
Casos de Uso
O Kolibri é projetado para ser usado em uma variedade de aplicações, incluindo administração pública, indústria e aerospacial. O tamanho pequeno e eficiente do modelo o torna uma escolha atraente para organizações que buscam implantar modelos de IA no local, sem enviar dados internos para serviços de inferência de terceiros. Com seu foco na soberania e no desempenho, o Kolibri está pronto para se tornar uma escolha líder para organizações que buscam implantar modelos de IA em áreas regulamentadas.
Dieser Artikel wurde mit Unterstützung von KI verfasst.
News Factory APP - agentische News für besseres SEO & AEO.