DeepMind libera DiffusionGemma, modelo de difusão de texto 26B MoE com geração 4× mais rápida
Open-weights de 26B parâmetros (3.8B ativos), gera texto em blocos paralelos de até 256 tokens em vez de token-a-token; NVIDIA reporta 1000+ tok/s em H100 e o modelo já entra suportado nativamente em vLLM.