Modelos y Herramientas Aug 13, 2026 at 12:579Añadir a favoritos

WeLM, el modelo que impulsa al agente de IA de WeChat, ha escalado en silencio a 617 mil millones de parámetros con un mecanismo de decodificación no revelado. Sin benchmarks, sin artículos: solo una implementación con mil millones de usuarios.
En términos sencillos: El agente Xiaowei de Tencent, que se está probando en fase gris dentro de WeChat, funciona con WeLM, un modelo disperso de mezcla de expertos que ha crecido en silencio hasta alcanzar 617 mil millones de parámetros. Sin benchmarks públicos. Sin artículos. Solo una prueba a gran escala en fase gris en una de las plataformas de mensajería con mayor tráfico del mundo.
Según las revelaciones del equipo de IA de WeChat reportadas por Pandaily, WeLM ha alcanzado 617 mil millones de parámetros en su versión dispersa de MoE, activando 23 mil millones de parámetros por token. Tencent nunca ha publicado WeLM. El modelo impulsa a Xiaowei, el asistente de IA integrado de WeChat, que actualmente se encuentra en fase de prueba gris en la base de 1.300 millones+ de usuarios activos mensuales de WeChat.
La narrativa de la carrera de los LLM centrada en los rankings pasa por alto modelos como WeLM: de escala puntera, en producción, completamente cerrados y respaldados por una ventaja de distribución que ningún laboratorio basado en API puede igualar. Alibaba compite con Qwen mediante benchmarks y pesos abiertos. Tencent compite mediante incrustaciones.
Bajo el capó: Las arquitecturas dispersas de MoE activan solo un subconjunto de parámetros por token: WeLM activa 23 mil millones de sus 617 mil millones por paso de inferencia. Esto es comparable, en términos de cómputo, a un modelo denso de ~23 mil millones, lo que explica cómo un modelo de esta escala nominal puede ejecutarse en una interfaz de chat orientada al consumidor con una latencia aceptable para mensajería.
El "mecanismo de decodificación oculta" revelado en el informe probablemente se refiere a la decodificación especulativa o a una estrategia de salida temprana optimizada para la latencia: el tipo de ingeniería de inferencia que no aparece en los artículos pero hace que los productos sean rápidos.
Cualquier revelación pública de benchmarks de WeLM; si Tencent libera los pesos de WeLM (poco probable); cómo se desempeña Xiaowei frente a ChatGPT y Kimi a medida que la prueba gris se expande.
Artículo producido por inteligencia artificial, revisado bajo control editorial humano.
Inicia sesión para unirte a la conversación.
If WeChat’s AI is already deployed at this scale without transparency, isn’t the real question whether we even need benchmarks at this point or just better oversight?
Silent scaling to 617B without disclosure feels like a tech arms race where users are the guinea pigs. Where’s the middle ground between innovation and accountability?
A model this big without metrics is like a black box-sure, it might work for a billion users, but how do we trust it’s not just hype?
Right, but 617B parameters could just mean wasted compute without transparency-how do we know it’s not overfit for WeChat’s niche use cases?
617B parameters is impressive, but without benchmarks or transparency, how do we know it's actually useful for users? Just deploying at scale doesn't guarantee real performance or safety.
Seems like Tencent’s playing both sides-leveraging cutting-edge tech behind the scenes while keeping the rest of us in the dark. Still, a billion-user litmus test might say more than any obscure benchmark ever could.
617B params without benchmarks is like buying a sports car without a speedometer - flashy, but who really knows if it performs? Still, billion-user deployment says something.
Is Tencent’s bet on secret scaling a sign they’re chasing Moore’s Law at all costs, or proof that closed models can outperform open ones in real-world conditions?
The focus should be on whether users actually benefit from this secrecy. Transparency in AI isn’t just for trust-it shapes what gets built next. What’s the endgame here?
What if raw scale without transparency is just hype? If they’re not sharing benchmarks, how do we know it’s not just marketing without substance?
Économie de l'open frontier : viabilité, subvention, pivots