Tecnologia

Inkling: Nosso modelo de pesos abertos

📅 15 Jul 2026 ⏱ 7 min de leitura 📰 Thinkingmachines.ai
Inkling: Nosso modelo de pesos abertos

Our mission is to build AI that extends human will and judgment. Desenvolvemos uma plataforma que permite a qualquer pessoa personalizar modelos, visualizar um sistema de IA construído para colaboração interativa e publicar novas pesquisas. Hoje estamos avançando em nossa missão ao lançar um modelo que treinamos do zero com todos os pesos disponíveis, para que as pessoas possam personalizá-lo.

Nosso modelo, denominado Inkling, é um transformador Mixture-of-Experts com parâmetros totais de 975B e 41B ativos. Ele suporta uma janela de contexto de até 1 milhão de tokens. Foi pré-treinado em 45 trilhões de tokens de texto, imagens, áudio e vídeo.

É o primeiro de uma família de modelos de diferentes tamanhos: ao lado dele compartilhamos uma prévia do Inkling-Small, um modelo mais leve com parâmetros ativos de 12B, treinado com uma receita semelhante, que atinge forte desempenho com custo e latência ainda mais baixos. Inkling raciocina nativamente em texto, imagens e áudio e equilibra custo com desempenho por meio de um esforço de pensamento eficiente e controlável. Nós o treinamos para ser um modelo de base amplo e equilibrado: forte em muitos domínios, flexível o suficiente para se adaptar.

Inkling não é o modelo geral mais forte disponível hoje, aberto ou fechado. Em vez disso, uma combinação de qualidades torna-o uma boa base aberta para personalização: capacidades multimodais, pensamento eficiente e disponibilidade no Tinker para ajuste fino. Inkling é apenas o começo: nosso primeiro lançamento em uma família de modelos na qual continuaremos a desenvolver.

Queremos tornar a personalização acessível para mais casos de uso, então o Inkling está disponível para ajustes no Tinker hoje. Picking the right base model to fine-tune is a qualitative judgment that combines measurable benchmarks with the unique feel of a model that comes from playing with it. Para habilitar este último, estamos adicionando o Inkling Playground no console Tinker: uma interface voltada para o desenvolvedor para conversar com o Inkling.

To show what customization means in practice, we asked Inkling to fine-tune itself. Usando o Tinker, o modelo escreveu seu próprio trabalho de ajuste fino, executou-o e avaliou o resultado: aplicações do mundo real exigem modelos com uma ampla gama de recursos que podem ser combinados e melhorados com ajuste fino. Mostramos o que o Inkling pode fazer e como ele avalia qualidades importantes, como confiabilidade e segurança.

Inkling foi projetado para ser amplo. We trained it across agentic, reasoning, coding, instruction-following, factuality, vision, and audio tasks, rather than narrowly optimizing for one domain. Essa amplitude é importante para a personalização e o uso no mundo real: diferentes usuários precisam de modelos que possam se adaptar a fluxos de trabalho muito diferentes, e não apenas se destacarem em benchmarks.

Uma base sólida para o ajuste fino precisa resolver com flexibilidade uma ampla variedade de tarefas com o uso de ferramentas de agente. O Inkling tem uma boa pontuação entre os modelos de pesos abertos na maioria dos benchmarks de agências. Treinamos o Inkling para ser executado em uma variedade de sistemas de codificação e agentes, e randomizamos o conjunto de ferramentas e o esquema durante o treinamento para reduzir a sensibilidade a qualquer um em particular.

O esforço de pensamento controlável de Inkling, descrito na próxima seção, pode ser definido dentro do arnês. Abaixo estão algumas demonstrações que mostram a codificação agente e o uso de ferramentas do Inkling e os artefatos que ele cria. Inkling construiu um aplicativo da web funcional em uma única tentativa e, em seguida, acionou um assistente de IA integrado que pode operar a interface do aplicativo da web por meio de instruções em linguagem natural.

Inkling was evaluated on Design Arena’s Agentic Web Dev leaderboard, where blinded human evaluators compare generated web apps head to head. Está entre os modelos de peso aberto mais fortes. O Inkling cria artefatos de várias páginas com instruções precisas, informações precisas e estilo e design coesos.

Inkling refinou um jogo de cobra online por meio de 40 iterações de feedback do GPT Codex atuando como revisor. A capacidade de sustentar um longo processo de refinamento e melhorar a partir do feedback é crucial para criar o melhor trabalho colaborativo. O escalonamento do tempo de teste e a resolução de problemas são os principais recursos de cada modelo, mas é difícil capturar essa capacidade com um único número.

Os desenvolvedores que ajustam modelos para uma tarefa especializada se preocupam tanto com a eficiência quanto com o desempenho do esforço máximo em um benchmark público. O custo e a latência são muitas vezes restrições vinculativas em aplicações do mundo real, e a baixa latência, em particular, é crucial para permitir a colaboração e a melhoria através da iteração. O Inkling oferece suporte ao esforço de pensamento controlável, permitindo equilibrar desempenho com eficiência simbólica.

O gráfico acima mostra a curva de esforço/desempenho do Inkling, bem como de outros modelos de peso aberto em uma variedade de benchmarks: Terminal Bench 2.1 para codificação de agentes, HLE para raciocínio avançado e IFBench para acompanhamento de instruções. Inkling gasta um terço de tokens para alcançar o mesmo desempenho do Nemotron 3 Ultra no Terminal Bench. O custo e a latência são importantes para um modelo que você executa milhões de vezes e como parte de fluxos de trabalho mais longos; observar a curva de custo total permite que os desenvolvedores escolham o melhor modelo para cada caso de uso.

Um dos principais objetivos do design de Inkling é servir como modelo de raciocínio de fundo no sistema de modelos de interação que introduzimos recentemente. Os modelos de interação permitem ao usuário colaborar naturalmente, utilizando voz e visão em tempo real. Isso requer um modelo treinado nativamente para amplas capacidades multimodais.

Benchmarks de áudio e visão em relação a modelos omni especializados (peso aberto e fechado), relatados com esforço = 0,99. Os componentes multimodais foram treinados do zero em dados de domínio geral. Optamos por uma arquitetura sem codificador para entradas de áudio e visão, consistente com o design do modelo de interação.

Os sinais de áudio são inseridos como espectrogramas dMeldMel: Speech Tokenization made Simple (Richard He Bai et al, 2024), enquanto as imagens são codificadas como patches de 40x40 pixels usando um hMLPTrês coisas que todos deveriam saber sobre Vision Transformers (Hugo Touvron et al, 2022). Ambos são transformados por meio de uma camada de incorporação leve e processados ​​em conjunto com tokens de texto. O Inkling transcreve a fala, segue instruções faladas, responde a perguntas sobre gravações e explica os motivos em áudio de formato mais longo.

Esses recursos o colocam entre os modelos de áudio de peso aberto mais fortes em VoiceBench, MMAU e AudioMC. Para a visão, o Inkling aceita imagens como entrada e pode descrever o conteúdo visual, responder perguntas e realizar raciocínios aprofundados com base nas informações visuais fornecidas. Ele demonstra forte desempenho em gráficos, diagramas e tarefas de raciocínio visual matemático.

Durante a inferência, o Inkling também pode aproveitar uma ferramenta Python para apoiar a compreensão da imagem por meio de operações como zoom e corte, ao mesmo tempo que integra perfeitamente o raciocínio visual com o raciocínio baseado em código. Como nosso primeiro lançamento, o Inkling estabelece uma base multimodal robusta para trabalhos futuros. Esperamos que suas capacidades multimodais continuem melhorando à medida que expandimos o modelo e o pipeline de treinamento nas iterações subsequentes.

Treinamos o Inkling para calibração, seguimento de instruções e resistência à censura, que chamamos coletivamente de epistêmica do modelo. Acertar os fatos exige mais do que memorizar um grande corpus de conhecimento. Um modelo útil deve ser bem calibrado, expressando a quantidade certa de confiança nas suas respostas – inclusive em questões que ainda não foram resolvidas.

Esta última é uma capacidade crucial para previsão e previsão, um caso de uso importante onde modelos ajustados mostraram uma rápida melhoria nos últimos meses, superando os LLMs de fronteira. Os resultados foram obtidos durante testes entre 30 de junho e 13 de julho de 2026 em um posto de controle do Inkling diferente daquele divulgado. A previsão requer a integração de múltiplas fontes de informação em uma probabilidade calibrada, uma habilidade essencial para um modelo em que os usuários podem confiar.

Um modelo que confia em todas as respostas que dá, inclusive quando faltam informações e confabula, força o usuário a verificar tudo novamente. Um modelo que dá a medida apropriada de confiança somos nós

AILLMPythonAPIXopenweightsmodelinklingfirstmultimodalmixture
Fonte: Thinkingmachines.ai

💬 Comentários

Carregando comentários…