Hy3 da Tencent: Modelo MoE Aberto de 295B Parâmetros Redefine a Eficiência da IA

Asif Razzaq

A equipe de pesquisa Hy da Tencent acaba de lançar o Hy3, um novo marco no cenário da Inteligência Artificial. Este modelo inovador é um Mixture-of-Experts (MoE) de 295 bilhões de parâmetros, mas sua grande sacada está na eficiência: ele ativa apenas 21 bilhões de parâmetros por token. Lançado sob a licença Apache 2.0, o Hy3 da Tencent promete revolucionar tarefas de raciocínio complexo, fluxos de trabalho de agentes autônomos e processamento de contextos longos, oferecendo um equilíbrio impressionante entre capacidade e otimização computacional.

O Que É o Hy3 da Tencent? Uma Nova Abordagem para Modelos de Linguagem

O Hy3 se destaca por sua arquitetura engenhosa. Ele emprega uma estrutura MoE esparsa que compreende 192 ‘experts’. Contudo, para cada token processado, apenas 8 desses experts são ativados, garantindo que a demanda computacional permaneça significativamente baixa. Essa abordagem permite que o modelo seja gigantesco em termos de conhecimento, mas ágil e eficiente em sua operação diária. O segredo da eficiência do Hy3 da Tencent está na seleção inteligente de quais partes do modelo são relevantes para cada pedaço de informação.

Além disso, o Hy3 integra uma camada de Multi-Token Prediction (MTP). Essa camada inovadora tem a capacidade de prever múltiplos tokens simultaneamente, resultando em uma decodificação consideravelmente mais rápida. Essa funcionalidade é habilitada por meio de técnicas de speculative decoding, suportadas por frameworks como vLLM e SGLang, acelerando ainda mais a resposta do modelo e a experiência do usuário.

Os Números Por Trás do Hy3: Uma Visão Detalhada da Arquitetura

Para entender a magnitude e a sofisticação do Hy3, vale a pena observar suas especificações técnicas:
Arquitetura: Mixture-of-Experts (MoE)Total de parâmetros: 295 bilhõesParâmetros ativados por token: 21 bilhõesParâmetros da camada MTP: 3.8 bilhõesCamadas (excluindo MTP): 80Camadas MTP: 1Heads de atenção: 64 (GQA, 8 KV heads, head dim 128)Tamanho oculto (Hidden size): 4096Tamanho intermediário (Intermediate size): 13312Comprimento de contexto: 256K tokensTamanho do vocabulário: 120832Experts: 192 experts, com 8 ativados por vez (top-8 routing)Precisões suportadas: BF16

A Tencent também lançou um checkpoint separado do Hy3 otimizado para FP8. Essa versão de precisão reduzida visa diminuir significativamente a pegada de memória, tornando o serviço do modelo mais acessível e economicamente viável para empresas e desenvolvedores.

Desempenho e Comparativos: Onde o Hy3 Brilha nos Benchmarks

A equipe de pesquisa do Hy3 da Tencent divulgou resultados impressionantes em diversas áreas críticas para a IA moderna. Em testes de codificação, o Hy3 alcançou:
SWE-Bench Verified: 78.0SWE-Bench Pro: 57.9SWE-Bench Multilingual: 75.8Terminal-Bench 2.1: 71.7DeepSWE: 28.0

No que diz respeito a tarefas de STEM (Ciência, Tecnologia, Engenharia e Matemática) e raciocínio, os números são ainda mais promissores:
GPQA Diamond: 90.4USAMO 2026: 72.0IMOAnswerBench: 90.0HLE (com ferramentas): 53.2Estes resultados demonstram a robustez do Hy3 em lidar com desafios intelectuais complexos, indo além da simples geração de texto.

Para validar o desempenho em cenários reais, a Tencent conduziu um teste cego envolvendo 270 especialistas da indústria, coletando 312 comparações válidas em fluxos de trabalho práticos. O Hy3 obteve uma pontuação média de 2.67 de 4, superando o GLM-5.1 (2.51). A vantagem foi mais evidente em áreas como desenvolvimento frontend, CI/CD (Integração Contínua/Entrega Contínua) e gerenciamento de dados e armazenamento. Esse feedback real de especialistas valida o potencial do Hy3 da Tencent para aplicações práticas.

Confiabilidade e Comportamento em Produção: O Foco da Tencent para o Hy3

Um aspecto crucial que a equipe de pesquisa da Tencent priorizou nesta versão do Hy3 foi a confiabilidade em ambientes de produção. Eles dedicaram atenção direta a três modos de falha comuns em modelos de IA, buscando solucioná-los com base em dados internos. Isso é fundamental para qualquer modelo que almeja ser usado em larga escala por empresas e desenvolvedores.

Superando Desafios Comuns em Agentes Baseados em LLMs

Entre as melhorias focadas na confiabilidade do Hy3 da Tencent, destacam-se:

Chamada de Ferramentas e Formatação de Saída: A equipe corrigiu problemas de estabilidade de base que frequentemente causavam falhas em agentes. Isso resultou em uma redução drástica de chamadas inválidas que poderiam disparar loops infinitos. O Hy3 também se mostra mais generalizável entre diferentes scaffoldings de agentes, mantendo a variância de precisão dentro de 4% no SWE-Bench Verified, usando diferentes estruturas como CodeBuddy, Cline e KiloCode.Conhecimento de Mundo e Anti-Alucinação: O objetivo era claro: o modelo deve responder quando houver evidências sólidas e sinalizar quando a informação estiver faltando. As avaliações internas mostraram uma queda na taxa de alucinação de 12.5% para 5.4%, e os erros de bom senso diminuíram de 25.4% para 12.7%. Isso garante respostas mais factuais e menos invenções por parte do modelo.Rastreamento de Intenção Multi-Turno: Melhorias em Joint SFT (Supervised Fine-Tuning) e RL (Reinforcement Learning) aprimoraram o rastreamento de co-referência e restrições em diálogos longos. A taxa de problemas internos caiu de 17.4% para 7.9%, e no benchmark de diálogo longo MRCR, as pontuações subiram de 42.9% para 75.1%. Isso significa que o Hy3 consegue manter o contexto e a coerência em conversas estendidas de forma muito mais eficaz.

Como Utilizar o Hy3 da Tencent: Integração e Recursos

A Tencent simplificou o acesso ao Hy3, que agora expõe uma API compatível com OpenAI. Para implementá-lo, basta usar vLLM ou SGLang e então chamar o endpoint. Uma funcionalidade interessante é o flag reasoning_effort, que permite controlar a ‘profundidade de pensamento’ do modelo. Ele pode ser definido como no_think (padrão, para respostas diretas), low ou high (para tarefas complexas que exigem uma cadeia de pensamento profunda, como matemática ou codificação multi-etapa).

A equipe de pesquisa da Tencent recomenda o uso de temperature=0.9 e top_p=1.0 para o melhor desempenho do Hy3 da Tencent. Para aqueles que desejam experimentar o modelo sem a necessidade de hardware local, o OpenRouter lista uma rota gratuita (tencent/hy3:free) que oferece o uso sem custo por token, com previsão de término em 21 de julho de 2026.

Casos de Uso do Hy3: Onde o Modelo Faz a Diferença na Prática

O Hy3 foi projetado com foco em fluxos de trabalho de agentes e tarefas que demandam contexto longo. Vejamos alguns exemplos concretos onde ele pode ser um divisor de águas:

Agentes de Codificação: Imagine alimentar um repositório de código completo na janela de contexto de 256K do Hy3. Você pode pedir ao modelo para corrigir um teste falho, definindo reasoning_effort=”high”. Suas chamadas de ferramentas estáveis o ajudam a realizar edições em vários arquivos com precisão.Processamento de Documentos: Com sua capacidade anti-alucinação, o Hy3 é ideal para processar contratos longos ou arquivos. Ele reduz a probabilidade de cláusulas fabricadas ou citações errôneas, garantindo a integridade da informação.Análise Financeira: Combinar tabelas e prosa em um único prompt para pedir um resumo fundamentado que sinalize dados ausentes em vez de tentar adivinhar. O modelo se recusa a ‘alucinar’ informações financeiras cruciais.Desenvolvimento Frontend e de Jogos: Gerar um componente React ou um pequeno loop de jogo. Os resultados do teste cego mostraram uma vantagem do Hy3 sobre o GLM-5.1 em desenvolvimento frontend, indicando sua proficiência nessa área.

Hy3 vs. GLM-5.2: Mais Leve, Mas Incrivelmente Competitivo

A equipe de pesquisa da Tencent também comparou o Hy3 com o GLM-5.2, um modelo MoE de aproximadamente 744 bilhões de parâmetros com cerca de 40 bilhões de parâmetros ativos. O Hy3 da Tencent, com menos da metade do tamanho total e 21 bilhões de parâmetros ativos, mostra uma impressionante capacidade de competir. Embora o GLM-5.2 leve a melhor em benchmarks de codificação, o foco do Hy3 é a otimização de tamanho e eficiência, sem comprometer significativamente o desempenho.

Abaixo, um comparativo direto em benchmarks de codificação:

BenchmarkHy3 (21B ativos)GLM-5.2 (~40B ativos)SWE-Bench Verified78.084.2SWE-Bench Multilingual75.883.0Terminal-Bench 2.171.781.0DeepSWE28.046.2Total / parâmetros ativos295B / 21B~744B / ~40BLicençaApache 2.0Open weights

Este comparativo ressalta que o Hy3 não busca apenas os maiores scores brutos, mas sim uma relação custo-benefício e eficiência computacional de ponta, tornando-o uma opção altamente relevante para desenvolvedores e empresas que buscam desempenho robusto com menor sobrecarga de recursos. Para mais detalhes, você pode consultar a fonte oficial da Tencent.

Conclusão: O Hy3 da Tencent Pavimenta o Caminho para a Próxima Geração de IA

O lançamento do Hy3 pela Tencent é um passo significativo para o futuro da Inteligência Artificial. Ao combinar uma arquitetura MoE massiva com uma ativação de parâmetros altamente eficiente e foco em confiabilidade em produção, o Hy3 da Tencent se posiciona como uma ferramenta poderosa para a criação de agentes de IA mais autônomos, sistemas de raciocínio mais robustos e aplicações capazes de lidar com contextos de longa duração. Sua natureza de código aberto sob a licença Apache 2.0 democratiza o acesso a tecnologias de ponta, permitindo que a comunidade global explore e construa sobre essas inovações, impulsionando a próxima onda de avanços em IA. [LINK_INTERNO]

FAQ: Perguntas Frequentes sobre o Modelo Hy3 da Tencent

O que significa um modelo MoE com "parâmetros ativos"?

Um modelo Mixture-of-Experts (MoE), como o Hy3 da Tencent, possui um grande número total de parâmetros, organizados em ‘experts’. No entanto, para cada entrada (ou token), apenas um subconjunto específico desses experts (e, consequentemente, de seus parâmetros) é ativado. Isso significa que, embora o modelo tenha acesso a um vasto conhecimento representado por todos os seus parâmetros, ele só usa a fração necessária para uma tarefa específica, economizando significativamente o poder de computação e a memória exigidos durante a inferência.

Em quais cenários o Hy3 da Tencent se destaca mais?

O Hy3 é particularmente eficaz em cenários que exigem raciocínio complexo, como resolução de problemas de STEM (Ciência, Tecnologia, Engenharia e Matemática), e em tarefas que demandam um longo contexto, como processamento de documentos extensos ou conversas multi-turno. Ele também foi otimizado para fluxos de trabalho de agentes de IA, como agentes de codificação, onde a confiabilidade na chamada de ferramentas e a redução de alucinações são críticas.

Gostou da notícia?

Inscreva-se na nossa newsletter e receba as principais novidades sobre inteligência artificial diretamente no seu e-mail.

Fonte: https://www.marktechpost.com

Veja também