Modelos
A EvaGPT oferece suporte para que você utilize diferentes modelos de IA, dependendo de suas necessidades, para criar experiências envolventes através de agentes de IA conversacional. Isso inclui modelos da OpenAI, Anthropic, Mistral, DeepSeek, Perplexity, Meta, Google, entre outros.
Tabela de Modelos Disponíveis
| Nome do modelo | Descrição curta | Proporção de tokens | Tamanho do contexto |
|---|---|---|---|
| GPT (OPENAI) | |||
| gpt-3.5-turbo | Modelo rápido e econômico para tarefas mais simples. | 0.0833 | 16.384 |
| gpt-3.5 Turbo Instruct | GPT-3.5 Turbo é um modelo rápido e barato para tarefas mais simples. | 0.1111 | 4096 |
| gpt-4 | Modelo de inteligência conversacional de alta capacidade. | 3.3333 | 8.192 |
| gpt-4-turbo | Modelo avançado em desempenho e precisão, com respostas mais rápidas. | 1.6667 | 128.000 |
| gpt-4.1 | Modelo principal da OpenAI para tarefas complexas. | 0.4444 | 1.047.576 |
| gpt-4.1-mini | Equilíbrio entre inteligência, velocidade e custo. | 0.0889 | 1.047.576 |
| gpt-4.1-nano | Modelo gpt-4.1 mais rápido e econômico. | 0.0222 | 1.047.576 |
| gpt-4.5 | Destaca-se em tarefas que se beneficiam do pensamento e da conversa criativos e abertos. | 8.3333 | 128.000 |
| gpt-4o | Mais rápido e mais barato que o GPT-4 Turbo, com capacidades de visão robustas. | 0.5556 | 128.000 |
| gpt-4o-mini | Modelo mais eficiente em termos de custo da OpenAI. Contexto de 128K. | 0.033 | 128.000 |
| gpt-5 | GPT-5 é um modelo de linguagem de nova geração com recursos de raciocínio e desempenho aprimorado em todos os domínios. | 0.5556 | 400.000 |
| gpt-5 Codex | Uma versão especializada do GPT-5, otimizada para engenharia de software e fluxos de trabalho de programação. | 0.5556 | 400000 |
| gpt-5-Mini | Versão econômica do GPT-5, oferecendo excelente desempenho para a maioria das tarefas. | 0.1111 | 400.000 |
| gpt-5-Nano | O modelo mais leve e rápido da família GPT-5, otimizado para tarefas simples. | 0.0222 | 400.000 |
| gpt-5.1 | Oferece raciocínio mais forte, melhor adesão às instruções e um estilo conversacional mais natural. | 0.5556 | 400.000 |
| gpt-5.1 Codex | Esta é uma versão especializada do GPT-5.1 otimizada para engenharia de software e fluxos de trabalho de programação. | 0.5556 | 400000 |
| gpt-5.1 Codex Max | Este é um modelo de codificação da OpenAI, projetado para tarefas de desenvolvimento de software de longo prazo e alto contexto. | 0.5556 | 400000 |
| gpt-5.1 Codex Mini | GPT-5.1-Codex-Mini é uma versão menor e mais rápida do GPT-5.1-Codex. | 0.1111 | 400000 |
| gpt-5.2 | O GPT-5.2 é o membro rápido e leve da família 5.2, otimizado para conversas rápidas, enquanto mantém forte inteligência geral. | 0.7778 | 400.000 |
| gpt-5.2 Codex | Esta é uma versão especializada do GPT-5.2 otimizada para engenharia de software e fluxos de trabalho de programação. | 0.7778 | 400000 |
| gpt-5.3 Codex | Este é um modelo de codificação especializado da OpenAI, otimizado para fluxos de trabalho de engenharia de software e tarefas autônomas de código de longa duração. | 0.7778 | 400000 |
| gpt-5.4 | O GPT-5.4 é o modelo de fronteira da OpenAI para trabalhos profissionais complexos, oferecendo a maior capacidade da série GPT-5. | 0.8333 | 1050000 |
| gpt-5.4 Nano | Modelo GPT-5.4 mais barato da OpenAI para tarefas simples de alto volume, como classificação, extração de dados, classificação e subagentes. | 0.0694 | 400000 |
| gpt-5.5 | Modelo de fronteira mais novo da OpenAI para trabalhos profissionais mais complexos, oferecendo desempenho de codificação mais forte e raciocínio avançado. | 1.6667 | 1050000 |
| SÉRIE "O" (OPENAI) | |||
| o1 | Modelo de raciocínio com 128K tokens de contexto. Atenção: temperatura deve ser mantida em 1. | 3.3333 | 128.000 |
| o3 | Modelo versátil e poderoso, destaque em matemática, ciência, programação e raciocínio visual. | 0.4444 | 200.000 |
| o3 Deep Research | Modelo avançado da OpenAI para pesquisa profunda, projetado para enfrentar tarefas complexas e de múltiplas etapas. | 2.2222 | 200000 |
| o3-mini | Modelo de raciocínio econômico, otimizado para codificação, matemática e ciências. | 0.2444 | 200.000 |
| o4-mini | Otimizado para raciocínio rápido e eficaz. | 0.2444 | 200.000 |
| CLAUDE (ANTHROPIC) | |||
| claude 3.5 Haiku | Modelo rápido e compacto da Anthropic para resposta quase instantânea. Ele responde perguntas e solicitações simples com rapidez. | 0.2222 | 200000 |
| claude 3.7 Sonnet | Modelo com capacidades aprimoradas de raciocínio, programação e resolução de problemas. | 0.8333 | 200.000 |
| claude 4 Opus | Considerado o melhor modelo de codificação do mundo na época do lançamento, trazendo desempenho sustentado em tarefas complexas e de longa duração. | 4.1667 | 200000 |
| claude 4 Sonnet | Aprimora significativamente as capacidades de seu antecessor, Sonnet 3.7, destacando-se tanto em tarefas de codificação quanto de raciocínio com precisão. | 0.8333 | 1000000 |
| claude 4.1 Opus | Modelo poderoso da Anthropic, com capacidades aprimoradas para raciocínio complexo, programação e tarefas criativas. | 4.1667 | 200000 |
| claude 4.5 Haiku | Modelo rápido e eficiente da Anthropic. | 0.2778 | 200.000 |
| claude Opus 4.5 | Otimizado para engenharia de software complexa e fluxos de trabalho agentivos. | 1.3889 | 200.000 |
| claude Sonnet 4.5 | Modelo avançado ajustado para agentes e programação de longa duração. | 0.8333 | 1.000.000 |
| claude-4.6-sonnet | Alto desempenho em programação, agentes e automação de fluxos de trabalho. | 0.8333 | 1.000.000 |
| claude Opus 4.6 | Eficiente para programação e tarefas profissionais de longa duração. | 1.3889 | 1.000.000 |
| claude 4.7 Opus | Modelo altamente capaz e disponível da Anthropic, construído para codificação avançada, fluxos de trabalho complexos de agentes e tarefas de visão. | 1.3889 | 1000000 |
| DEEPSEEK / LLAMA | |||
| llama-3.3-70b-versatile | Desenvolvido pela Meta, otimizado para tarefas com grandes volumes de dados. | 0.0439 | 128.000 |
| deepseek-r1-distill-llama-70b | Raciocínio de alto nível com avanço significativo na velocidade de processamento. | 0.055 | 128.000 |
| deepseek-chat-v3-0324 | Modelo baseado em mixture-of-experts com excelente desempenho em diversas tarefas. | 0.0489 | 164.000 |
| Deepseek V4 Flash | Raciocínio DeepSeek rápido e econômico para cargas de trabalho sensíveis à latência que ainda precisam de uma janela de contexto enorme e uso forte de ferramentas. | 0.0156 | 1000000 |
| Deepseek V4 Pro | Raciocínio e codificação de alto nível em DeepSeek para as cargas de trabalho de produção mais exigentes. | 0.0483 | 1000000 |
| GEMINI / GEMMA (GOOGLE) | |||
| gemini-1.5-flash | Modelo rápido com excelente desempenho para tarefas diversas e repetitivas. | 0.0167 | 1.048.576 |
| gemini-1.5-pro | Modelo de maior inteligência da série Gemini 1.5, com janela de contexto de 2 milhões de tokens. | 0.2778 | 2.097.152 |
| gemini-2.0-flash | Modelo multimodal com excelente desempenho e janela de contexto de 1 milhão de tokens. | 0.0222 | 1.048.576 |
| gemini-2.5-flash | Modelo multimodal capaz e de baixo custo. | 0.1944 | 1.048.576 |
| gemini 2.5 Flash Lite | Um modelo multimodal pequeno e econômico, construído para uso em escala com uma janela de contexto de 1 milhão de tokens. | 0.0222 | 1048576 |
| gemini-2.5-pro | Modelo multimodal de alta capacidade construído para a era dos Agentes. | 0.8333 | 1.048.576 |
| gemini-3-flash | Modelo de raciocínio de alta velocidade para fluxos de trabalho agentivos. | 0.1667 | 1.048.576 |
| gemini 3 pro | Gemini 3 Pro é o modelo fronteireiro principal do Google para raciocínio multimodal de alta precisão, combinando forte desempenho em texto, imagem, vídeo, áudio e código | 0.6667 | 1000000 |
| gemini 3.1 Flash Lite | O Gemini 3.1 Flash Lite Preview é o modelo de alta eficiência do Google, otimizado para casos de uso de alto volume, melhorando o Gemini 2.5 Flash Lite. | 0.0833 | 1000000 |
| gemini-3.1-pro | Raciocínio multimodal de alta precisão em texto, imagem, vídeo, áudio e código. | 0.6667 | 1.048.576 |
| gemma 4 31b | Mmodelo multimodal do Google DeepMind, com entrada de texto e imagem, saída de texto, raciocínio configurável, chamada de funções nativa e suporte multilíngue. | 0.0222 | 262144 |
| GLM | |||
| GLM 4.5 Air | O GLM-4.5-Air é a variante leve da mais recente família de modelos topo de linha da Z.AI, projetada especialmente para aplicações centradas em agentes. | 0.0611 | 128000 |
| GLM 4.7 | Modelo principal da Z.AI, com 200K de contexto, saída de 128K e desempenho de última geração em benchmarks de codificação e raciocínio. | 0.1222 | 200000 |
| GLM 4.7 Flash | Modelo rápido e econômico da Z.AI, otimizado para programação, fluxos de trabalho agentivos e uso no mundo real com orçamentos de hardware mais baixos. | 0.0222 | 200000 |
| GLM 5 | Modelo topo de linha de quinta geração da Z.AI, projetado para design de sistemas complexos, fluxos de trabalho de agentes de longo prazo e codificação em nível de produção. | 0.175 | 202800 |
| GLM 5 Turbo | Modelo GLM-5 otimizado para velocidade da Z.AI, para codificação agential de menor latência e fluxos de trabalho de produção em alto volume. | 0.2222 | 202800 |
| GLM 5.1 | Oferece um grande salto na capacidade de codificação, com ganhos particularmente significativos no manejo de tarefas de longo prazo. | 0.2389 | 202000 |
| GLM 5v Turbo | Modelo nativo de codificação multimodal da Z.AI para design-para-código, depuração visual e fluxos de trabalho de interface gráfica agente. | 0.2222 | 200000 |
| KIMI | |||
| Kimi K2.5 | Modelo multimodal de 1 trilhão de parâmetros da MoonshotAI com contexto de 256K, otimizado para programação, raciocínio e fluxos de trabalho agentes. | 0.1667 | 262114 |
| Kimi K2.6 | Demonstra desempenho particularmente forte em tarefas de codificação de longo prazo e produz design de nível profissional com código e visão. | 0.2222 | 262000 |
| MIMO | |||
| MiMo V2 Flash | MiMo-V2-Flash é um modelo de linguagem open-source Mixture-of-Experts da Xiaomi, com 309 B de parâmetros totais e 15 bilhões de parâmetros ativos. | 0.0167 | 262144 |
| MiMo V2 Pro | modelo de base de referência da Xiaomi, contando com mais de 1 trilhão de parâmetros totais e uma janela de contexto de 1 milhão de tokens, sendo profundamente otimizado para cenários de agentes. | 0.1667 | 1000000 |
| MINIMAX | |||
| MiniMax M2.5 | Modelo focado em produtividade do MiniMax no OpenRouter, ajustado para programação, fluxos de trabalho de escritório e documentos e execução de agentes em múltiplas etapas. | 0.0667 | 204800 |
| MiniMax M2.7 | Oferece forte desempenho real em engenharia de software em entrega de projetos de ponta a ponta, análise de logs, solução de bugs, segurança de código e fluxos de trabalho. | 0.0667 | 204800 |
| MISTRAL | |||
| mistral-large-latest | Raciocínio de alto nível para tarefas de alta complexidade. | 0.6667 | 32.000 |
| mistral-small-latest | Raciocínio econômico para cargas de trabalho de baixa latência. | 0.1667 | 32.000 |
| QWEN | |||
| qwen 3.6 Max | Apresenta capacidades aprimoradas de codificação, execução mais eficiente de agentes de programação e habilidades de desenvolvimento front-end significativamente melhores. | 0.4333 | 240000 |
| SONAR (PERPLEXITY) | |||
| sonar | Opção leve com fundamentação por busca em tempo real na internet. | 0.0556 | 128.000 |
| sonar-pro | Opção premium com fundamentação por busca em tempo real na internet. | 0.8333 | 128.000 |
| sonar-deep-research | Realiza pesquisas em tempo real na internet de nível especializado. | 0.4444 | 128.000 |
| sonar-reasoning | Opção premium com tecnologia DeepSeek R1 e Chain of Thought (CoT). | 0.2778 | 128.000 |
| sonar-reasoning-pro | Modelo de primeira linha com fundamentação avançada por busca e DeepSeek R1. | 0.4444 | 128.000 |
| GERAÇÃO DE IMAGENS | |||
| dalle2 | Modelo baseado na arquitetura DALL-E 2. | 1 | — |
| dalle3 | Modelo de alta qualidade para geração de imagens a partir de texto. | 1 | — |
| stablediffusion | Modelo baseado em Stable Diffusion para geração de imagens. | 1 | — |
| gpt-image-1 | Modelo de geração de imagens multimodal. | 2.2222 | — |
| gpt-image-1-mini | Versão compacta do modelo de geração de imagens. | 0.4444 | — |
| OUTROS | |||
| Personalizado | Quando se utiliza uma chave de API externa para qualquer modelo selecionado. | 0.0028 | — |
Escolha o modelo apropriado dependendo do seu caso de uso específico e desempenho desejado, de acordo com suas necessidades.
Personalização das Configurações do Modelo
Para personalizar as configurações de um modelo, dentro do ambiente de criar Agente ou editar Agente, clique em configurações avançadas, escolha o modelo e personalize suas propriedades.
Existem quatro propriedades principais que podem ser personalizadas: número máximo de tokens, temperatura, penalidade de frequência e penalidade de presença.
Número Máximo de Tokens
Esta propriedade determina o número máximo de tokens que o modelo pode consumir ao gerar uma resposta. Por padrão, isso é definido como o tamanho máximo do contexto para o modelo, mas você pode reduzi-lo para limitar a quantidade de recursos usados pelo modelo. Isso pode ajudar a economizar custos de token, mas, por outro lado, também pode reduzir a capacidade do agente de responder bem na conversa.
Temperatura
Esta propriedade determina o nível de aleatoriedade ou criatividade nas respostas do modelo. Um valor de temperatura mais alto resultará em respostas mais diversas e criativas, enquanto um valor mais baixo resultará em respostas mais conservadoras e previsíveis.
Penalidade de Frequência
Esta propriedade determina o quanto o modelo aceita a repetição de certas palavras ou frases em suas respostas. Um valor de penalidade de frequência mais alto resultará em respostas mais variadas e menos repetitivas.
Penalidade de Presença
Esta propriedade determina o quanto o modelo aceita o uso de certas palavras ou frases em suas respostas. Um valor de penalidade de presença mais alto resultará em respostas menos propensas a conter palavras ou frases específicas.
Ao personalizar essas propriedades, você pode ajustar o comportamento do modelo para melhor atender ao seu caso de uso específico e seus requisitos. No entanto, é importante observar que a alteração dessas propriedades pode ter um impacto significativo no desempenho e na precisão do modelo, portanto, é recomendável experimentar e testar diferentes configurações para encontrar o melhor equilíbrio entre desempenho e criatividade.