O que mudou de acordo com a Google
A Google posiciona o 3.6 Flash como um avanço direto além do 3.5 Flash para codificação, trabalho com conhecimento, tarefas multimodais, eficiência de tokens e execução agentic. O release de 21 de julho informa US$ 1,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída para o 3.6 Flash e diz que esse valor é menor que o do 3.5 Flash. Preços, disponibilidade, quotas e rótulos de preview ou versão estável podem mudar, portanto registre o ID do modelo e a página de preços no dia do teste.
O lançamento também relata menos edições de código indesejadas e menos loops de execução, além de melhorias no DeepSWE, MLE Bench, OSWorld-Verified e GDPval-AA v2. Esses resultados são hipóteses úteis para tarefas de repositório Unreal, análise de logs, revisão de capturas de tela e planejamento assistido por ferramentas. Eles não são evidência de correção de APIs do Unreal, compilação de Blueprint, estabilidade do editor ou desempenho de build empacotado.
Repetir suíte para uma migração de Unreal
- Dez questões fechadas sobre a arquitetura específica do projeto, com a resposta fonte correta já conhecida.
- Cinco correções limitadas em C++ com baseline limpo de compilação e automação.
- Cinco tarefas de planejamento de Blueprint usando as mesmas capturas de tela, texto exportado e transições de estado esperadas.
- Cinco tarefas de triagem de falhas em crash, cook, empacotamento, renderização ou rede com causas raiz verificadas.
- Três revisões de regressão multimodal usando capturas antes e depois e defeitos conhecidos.
- Duas tarefas de agente de longa duração com limites de permissão, checkpoints, cancelamento e rollback limpo
Tabela de decisão
| Criterion | Expectativa de teste do 3.6 Flash | Portão de migração |
|---|
| Edições de código | Menos edições indesejadas e menos loops é a direção reportada pelo fornecedor | Taxa de diferença aceita maior sem aumento de regressão |
| Revisão multimodal | Análise visual e documental mais forte é a direção relatada pelo fornecedor | Melhor recall de defeitos sem alegações não suportadas |
| Eficiência de token | A Google relata 17% menos tokens de saída em um índice | Menor consumo total de tokens e custo para a tarefa completa |
| Uso de computador | A ferramenta integrada no cliente está disponível | Permissões em sandbox, confirmação, logs e etapa de rollback |
| Roteamento de produção | Use o ID exato do modelo e a disponibilidade atual | Fallback, compatibilidade de schema, quota, latência e validações de política passam |