Jev é um modelo de inteligência artificial que não escreve texto. Ele recebe o estado de uma situação, responde a perguntas definidas de antemão com valores tipados e probabilidades, e devolve o resultado entre 70 e 500 milissegundos. Lançado pela TypeSafe AI em 15 de setembro de 2026, destrava decisões que o software antes não tinha como consultar um modelo para tomar.
A diferença não está na inteligência. Está no lugar onde o modelo cabe. Um modelo que leva oito segundos para responder fica fora do caminho crítico do software. Um modelo que responde em trezentos milissegundos entra dentro dele.
O que é o Jev?
Jev é o primeiro modelo da classe que a TypeSafe AI chama de System One Models: modelos treinados para tomar decisões rápidas e estruturadas que o software usa diretamente. A aplicação envia o estado de uma situação e um conjunto de perguntas. O modelo devolve respostas tipadas com probabilidade associada, sem gerar nenhuma palavra.
A empresa foi fundada por Diogo Almeida, ex-pesquisador da OpenAI e um dos autores do artigo do InstructGPT, com Erik Gafni e Sasha Sheng. Segundo o Today for AI (setembro de 2026), a TypeSafe saiu de dois anos de operação sigilosa com uma rodada seed de US$ 40 milhões liderada pela DCVC.
O nome vem de William Stanley Jevons, economista do século 19, cujo paradoxo descreve como a queda no custo do carvão aumentou o consumo de carvão. A tese da empresa aplica o mesmo raciocínio à inteligência de máquina: cada ordem de grandeza a menos no custo de uma decisão multiplica o número de decisões que valem a pena automatizar. A classe do modelo vem de Daniel Kahneman, da separação entre pensamento rápido e pensamento deliberado.
O que muda quando o modelo devolve decisão em vez de texto?
Muda a forma de cobrança do tempo. Um modelo de linguagem gera a resposta token a token, de forma sequencial, e a aplicação ainda precisa interpretar e validar o texto recebido. O Jev avalia todas as perguntas declaradas em paralelo, em uma única passagem, e devolve os valores prontos.
A interface tem três tipos de pergunta, conforme a documentação da API resumida pelo ArchCrux em 21 de setembro de 2026. Choice escolhe entre até 255 opções e devolve a distribuição de probabilidade completa. Score avalia contra níveis ordenados, de 2 a 10, e devolve um valor contínuo. Noul responde a uma afirmação de sim ou não com a probabilidade de ser verdadeira. O contexto total é de 64 mil tokens, com 32 mil para o estado somado à pergunta mais longa.
A consequência prática aparece no preço. A TypeSafe cobra US$ 0,042 por milhão de tokens de entrada e não cobra pela saída, porque não há texto a medir. O anúncio de lançamento situa os modelos de linguagem de ponta entre US$ 0,20 e US$ 10 por milhão de tokens de entrada, com saída em torno de cinco vezes o valor da entrada.
| Critério | Modelo de linguagem | Modelo de decisão |
|---|---|---|
| Saída | Texto livre | Valor tipado com probabilidade |
| Geração | Sequencial, token a token | Paralela, passagem única |
| Latência declarada | 3 a 329 segundos ponta a ponta | 70 a 500 milissegundos |
| Preço de entrada | US$ 0,20 a 10 por milhão | US$ 0,042 por milhão |
| Preço de saída | Cerca de 5 vezes a entrada | Sem cobrança |
| Explicação do resultado | Presente | Ausente |
Fonte: anúncio da TypeSafe AI, 15 de setembro de 2026. Os números de latência e preço dos modelos de linguagem são os declarados pela própria empresa na comparação de lançamento.
Quanto o Jev é mais rápido e mais barato na prática?
Depende inteiramente do que está do outro lado da comparação. A TypeSafe declara até 193,6 vezes mais rápido e 444,6 vezes mais barato, e o próprio anúncio registra que esses números estão na ponta alta do que a empresa observou, não no resultado típico.
A TrueStandard mediu os dois extremos em 18 de setembro de 2026. Uma pergunta de sim ou não isolada levou 477 milissegundos de tempo de servidor no Jev, contra 790 no Gemini 3.1 Flash Lite e 928 no Claude Haiku 4.5. São 1,7 e 1,9 vezes. Contra um modelo com raciocínio estendido ligado, o Claude Fable 5.1 levou 2.575 milissegundos, o que dá 5,4 vezes.
O número grande aparece quando a comparação muda de forma. Seis julgamentos sobre um mesmo chamado de suporte, feitos em sequência por um modelo que delibera antes de responder, levaram 74,42 segundos e US$ 0,16251. As mesmas seis perguntas em uma requisição única ao Jev levaram 0,739 segundo e US$ 0,00002167. São 100,7 vezes mais rápido e 7.499 vezes mais barato.
O que move o multiplicador é a quantidade de julgamentos que colapsam em uma chamada. A mesma medição mostra que perguntar 1, 6, 13 e 20 questões sobre o mesmo documento praticamente não muda a mediana do tempo, que foi de 0,660 para 0,579 segundo, enquanto o custo por julgamento cai onze vezes. Uma pergunta adicional custa cerca de quinze tokens de entrada e nenhuma espera extra.
A AY Automate rodou 791 decisões rotuladas em 19 de setembro de 2026, com 3.955 chamadas e um único medidor de cobrança. O Jev ficou de 2,0 a 3,6 vezes mais rápido na mediana, de 4,7 a 7,5 vezes mais barato que os dois modelos pequenos mais baratos e de 40 a 49 vezes mais barato que o GPT-5.6 Terra. Os 193,6x e 444,6x não apareceram contra essas bases.
Quais casos de uso corporativos a baixa latência destrava?
Destrava as decisões que hoje não são tomadas por nenhum modelo, porque o custo e a espera não se justificam. São as decisões pequenas, repetitivas e de resposta fechada que o software toma milhares de vezes por dia e que hoje estão escritas como regra fixa.
O caso mais direto é o filtro que roda antes do classificador. Aman Kumar, em teste publicado em 18 de setembro de 2026 com cerca de 16 mil chamadas, colocou o Jev à frente de um classificador existente de páginas: a saída foi idêntica nas 1.005 páginas de cinco execuções de produção, com 50 a 67% menos chamadas de roteamento.
O segundo caso é a triagem de entrada. No mesmo teste, cada e-mail de uma caixa compartilhada disparava uma sessão de agente que custava cerca de doze centavos de dólar e 94 segundos de mediana para decidir se aquilo era um pedido de trabalho. O Jev acertou 87% dos casos contra o resultado registrado, e 96% nos casos em que estava confiante, que foram 69% do total.
O terceiro é a moderação e a classificação de conteúdo publicado. O site britânico Near Here testou anúncios de eventos e obteve 48 acertos em 50, contra 42 e 43 de dois modelos pequenos com raciocínio alto, em 0,6 segundo contra 2,9 e 3,4 segundos.
O quarto é a pontuação de candidatos contra a descrição de uma vaga. O HiringCafe mediu correlação de Spearman de 0,79 contra rótulos humanos, a dois centavos de dólar por mil avaliações, contra 0,77 do DeepSeek V4 Flash a quatorze centavos.
Há ainda os casos em que a latência é o produto. Quando a decisão precisa acontecer dentro de uma interação em andamento, três segundos de espera quebram a experiência e trezentos milissegundos não. Isso vale para roteamento de atendimento, para verificação durante o preenchimento de um formulário e para controle de navegador. O projeto Browser Use usa o Jev para escolher a operação e o elemento de tela, e chama um modelo de linguagem apenas quando há texto a escrever.
O que muda na supervisão de agentes de IA?
Muda o preço de verificar cada passo. Um agente que executa vinte passos precisa, a rigor, de uma checagem antes de cada ação com efeito no sistema. Com um modelo de linguagem como verificador, cada checagem custa segundos e centavos, e o time acaba escrevendo regras grosseiras para decidir quando vale a pena verificar.
O problema é conhecido e tem tamanho medido. O Gartner projetou, em junho de 2026, que 40% das organizações vão rebaixar ou desativar agentes autônomos até 2027 por lacunas de governança identificadas apenas depois de incidentes em produção, e que mais de 40% dos projetos de IA agêntica serão cancelados até o fim de 2027. O mesmo material descreve quatro níveis de autonomia e alerta que a aprovação humana explícita por ação, o nível 3, degrada sob pressão de tempo e fadiga de aprovação.
O custo entra pelo mesmo lado. A KPMG, no Global AI Pulse do segundo trimestre de 2026, registrou que 49% das organizações adiaram, reduziram ou reprogramaram planos com agentes porque o custo ficou acima do valor previsto, e que apenas 35% compreendem plenamente os custos operacionais de IA.
Um modelo de decisão muda a conta. A LangChain expôs o Jev como integração três dias depois do lançamento, com um componente que avalia chamadas de ferramenta e bloqueia as arriscadas antes da execução, e outro que escolhe qual modelo atende cada requisição. A Cloudflare e a Langfuse fizeram integrações no mesmo intervalo. A Vercel informou que o Jev teve a adoção mais rápida da história do seu AI Gateway: cerca de 13% dos times pagos em 24 horas, o dobro da família GPT-5.6 e seis vezes o Fable 5.1 no mesmo marco.
Para quem opera agentes de IA dentro de uma função, a leitura prática é simples. O que separa um assistente de um agente é a permissão de escrita. O que torna a permissão de escrita administrável é a existência de uma verificação barata o bastante para rodar em todas as ações, e não apenas nas que alguém se lembrou de marcar como sensíveis.
Para que serve a probabilidade calibrada?
Serve para definir onde o software age sozinho e onde ele chama uma pessoa. Um modelo de linguagem também informa uma confiança quando solicitado, mas o número que ele escreve costuma ser alto demais e pouco separável. A probabilidade do Jev se comporta de outro modo nos testes publicados até aqui.
No teste da AY Automate, a capacidade de ordenação da probabilidade do Jev teve AUROC de 0,990, a mais alta entre os cinco sistemas medidos. Com o corte de confiança em 0,80, respondendo apenas o que estava acima disso e encaminhando o resto ao GPT-5.6 Terra, a acurácia combinada igualou a do Terra sozinho, a 26 a 28% do custo e cerca de metade da latência média.
O teste de spam citado pela Arize mostra a mesma curva. Entre os e-mails com probabilidade abaixo de 0,1, apenas 0,1% era spam. Entre os acima de 0,9, 99,9% era. Na faixa de 0,5 a 0,6, apenas 38% era. A faixa do meio é a fila de revisão humana, e ela deixa de ser um palpite para virar um número.
É aqui que entra a exigência legal brasileira. O artigo 20 da LGPD assegura o direito de solicitar revisão de decisões tomadas unicamente com base em tratamento automatizado. Um limite de confiança explícito, definido sobre dados rotulados da própria empresa, é a forma operacional de cumprir esse direito sem travar o processo inteiro.
Onde o Jev erra?
Erra quando a entrada é longa, quando os rótulos se sobrepõem e quando a resposta exige vários passos de raciocínio. O padrão se repete em todos os testes publicados: acurácia e confiança caem juntas conforme o estado cresce.
Nos quatro conjuntos públicos medidos por Aman Kumar, o Jev ficou em 98,7% na classificação de spam da base Enron e 95,7% em análise de sentimento, acima dos modelos pequenos comparados. Na base Banking77, com 77 rótulos de intenção, caiu para 76,0%, contra 81,7% do modelo pequeno usado como referência. Em um teste de 2 mil e-mails de phishing, ficou em 62,6% contra 81,3% do Claude Haiku 4.5, e o resultado variou cinco pontos apenas pela redação da pergunta. Dividir a decisão em cinco sinais estreitos de sim ou não e combiná-los em código levou o mesmo conjunto a 95%.
A própria avaliação da TypeSafe mostra o limite. Na tarefa de processamento de faturas, o Jev marca 61,8% contra 79,1% do melhor modelo comparado, o pior resultado do painel. É exatamente o caso de leitura de documento inteiro.
Duas ressalvas de método pesam na leitura de qualquer número desta fase. A avaliação da TypeSafe pontua concordância com a média das respostas do GPT-6 Astra e do Claude Fable 5.1, e não contra gabarito verificado, e nessa métrica o Jev fica em 67,8% contra 74,1% do melhor modelo de linguagem. A AY Automate observou que a concordância com um modelo maior fica de 6 a 8 pontos acima da acurácia real, porque os dois erram junto. A empresa também não publicou arquitetura, contagem de parâmetros nem detalhe suficiente para reproduzir o método de treinamento, conforme registrou o ArchCrux em 21 de setembro de 2026.
A afirmação de que o modelo não alucina também merece leitura estreita. Laurie Voss, da Arize, em 18 de setembro de 2026, descreve o alcance real: o Jev não devolve resposta fora do conjunto declarado, mas pode escolher a opção errada dentro dele, com confiança alta. No teste da AY Automate, cinco erros com confiança acima de 0,93 eram todos o mesmo par de rótulos ambíguos, e o modelo de ponta comparado cometeu o mesmo erro nos cinco casos.
A perda mais cara é outra. O modelo não explica. Um verificador em texto devolve o motivo junto com o veredicto, e esse motivo alimenta correção de processo. O Jev devolve uma categoria e uma probabilidade, e nada mais.
Um modelo de decisão substitui o modelo de linguagem da empresa?
Não. Ele cobre a camada que o modelo de linguagem atende mal e cara. A própria TypeSafe posiciona o Jev para verificação, barreiras de segurança e decisões em torno de fluxos com modelos de linguagem, não como substituto.
A separação é de natureza da tarefa, não de qualidade. Redigir uma resposta ao cliente, resumir um contrato e escrever código continuam exigindo geração de texto. Classificar o chamado, decidir a fila, pontuar o risco e verificar se a ação proposta é segura são decisões de resposta fechada. O que existia até agora era uma escolha entre regra fixa, barata e cega, e chamada a modelo de linguagem, capaz e cara.
Essa arquitetura em duas camadas tem um pré-requisito que independe do modelo escolhido. A decisão só é boa se o estado enviado for bom. Um modelo de decisão que recebe um registro desatualizado responde rápido e responde errado, com confiança alta. O trabalho de garantir que o contexto da empresa chegue íntegro ao modelo continua sendo o mesmo, e continua sendo o gargalo.
Como testar um modelo de decisão sem abrir um projeto?
Testa-se com dados que a empresa já tem e com uma decisão que já é tomada hoje. O teste não precisa de integração nem de orçamento aprovado. Precisa de um conjunto de casos rotulados e de um resultado conhecido para comparar.
O caminho recorrente nos testes publicados tem quatro passos.
- Escolher uma decisão de resposta fechada que o software já toma por regra fixa ou por chamada a um modelo de linguagem. Triagem de chamado, roteamento de atendimento, classificação de documento curto.
- Separar de 200 a 500 casos com o resultado real registrado. O resultado real, não a opinião de outro modelo.
- Rodar o modelo de decisão sobre esses casos e medir duas coisas: a acurácia geral e a acurácia por faixa de confiança.
- Definir o limite de confiança sobre um conjunto separado do que foi usado para observar o comportamento, e decidir o que acontece na faixa do meio.
O quarto passo define o desenho. Acima do limite, o software age. Abaixo, encaminha para o modelo maior ou para uma pessoa. A empresa não troca de modelo, acrescenta uma camada que absorve o volume fácil.
Segundo o estudo ABES e IDC de 2026, 40% das médias e grandes empresas brasileiras já usam agentes inteligentes integrados às operações cotidianas, e outros 33% têm plano formal de implementação nos doze meses seguintes. Ao mesmo tempo, o relatório Maturidade da IA Corporativa no Brasil, produzido pelo Templo em 2026 com 382 profissionais, mostra Automação de Workflows em 35,0 pontos de 100, a pior das dimensões medidas, com 84% do uso concentrado em três interfaces de texto. O intervalo entre usar IA e automatizar decisão continua aberto.
Perguntas frequentes
O Jev está disponível para uso comercial no Brasil?
O modelo está em acesso antecipado desde 15 de setembro de 2026 e passou a ser aberto sem lista de espera no console da TypeSafe. As medições de latência publicadas pela empresa são feitas a partir da costa oeste dos Estados Unidos, onde o serviço está hospedado, então a latência de rede a partir do Brasil se soma ao número declarado.
O Jev processa imagens e documentos digitalizados?
Não na versão atual. O modelo aceita texto e dados estruturados. Documentos que exigem leitura de imagem precisam de uma etapa anterior de extração, e o desempenho no processamento de faturas é o mais fraco do painel da própria empresa, com 61,8%.
É preciso ter dados rotulados para usar?
Para usar, não. Para confiar no limite de confiança, sim. Todos os testes publicados que chegaram a um resultado utilizável ajustaram o corte sobre algumas centenas de casos rotulados da própria operação.
O modelo aprende com os dados da empresa?
A integração pela Vercel expõe retenção zero de dados e não treinamento, habilitados por requisição. A verificação dessa configuração é parte do desenho, não um detalhe de contrato.
A pergunta que o Jev coloca para uma empresa não é qual modelo usar. É quantas decisões o software toma hoje por regra fixa apenas porque consultar um modelo era caro demais. Esse número costuma ser grande, e agora ele é mensurável.
O Orchestra opera agentes de IA por função com o controle de decisão descrito acima. Vamos conversar sobre como isso afeta a sua empresa.

