O Jev, modelo de decisão lançado pela TypeSafe AI em 15 de setembro, é o primeiro de uma categoria que a empresa chama de “System One”: modelos que respondem perguntas fechadas com probabilidade, sem gerar texto. Floriano Varejão, Chief AI Officer do TEMPLO, conversou com Herman Bessler, CEO da empresa, sobre o que o modelo é, o que não é e onde ele entra na plataforma agêntica Orchestra. A conversa foi editada para clareza.
Herman Bessler: Em uma frase, o que é o Jev?
Floriano Varejão: É um classificador. Só que um classificador cem por cento genérico. Ele recebe um contexto e uma pergunta com respostas possíveis, e devolve qual resposta é a mais provável. Não escreve nada.
Para entender: classificador. Um classificador é um modelo que coloca uma entrada em uma categoria. “Este e-mail é spam ou não é” é classificação. “Esta foto é de um gato ou de um cachorro” também. Classificadores existem há décadas, mas cada um era treinado para uma tarefa fixa, com milhares de exemplos rotulados.
HB: Classificadores existem há muito tempo. O que muda?
FV: Os antigos eram limitados a coisas específicas. Treinava-se um para e-mail, outro para sentimento, outro para fraude. O Jev lida com qualquer circunstância. As categorias são descritas em palavras, no momento em que se faz a pergunta. Não precisa treinar nada. E o custo é muito menor, o que permite infinitos casamentos do Jev com modelos de linguagem.
HB: A vantagem, pelo que se entende, é ser mais rápido e mais barato. Mas a natureza é outra. Ele não produz texto.
FV: Exato. E isso não é limitação, é o ponto. A maioria das decisões dentro de um sistema não precisa de texto. Precisa de uma resposta. Isto é urgente ou não. Vai para a fila A, B ou C. Este comando pode ou não pode. Usar um modelo de linguagem para isso é gastar tempo e dinheiro gerando um parágrafo que ninguém vai ler, para no fim extrair um sim ou um não.
Para entender: os três tipos de resposta. O Jev responde de três formas. Escolha: uma opção entre até 255, cada uma descrita em palavras. Nota: uma posição em uma escala de dois a dez níveis, também descritos em palavras. Sim ou não: uma probabilidade entre zero e um. Várias perguntas podem ir na mesma chamada e são respondidas em paralelo, entre 70 e 500 milissegundos, segundo a TypeSafe.
HB: Um exemplo concreto, do dia a dia de uma empresa.
FV: Classificação de e-mail. Chega um e-mail. Hoje, um modelo de linguagem lê e decide se é comercial, suporte, financeiro, spam. Funciona, mas é caro e demora segundos. Com o Jev, a mesma decisão custa fração de centavo e leva milissegundos. E ele devolve a confiança da decisão, coisa que os modelos de linguagem não devolvem. Isso dá muito mais assertividade em automação.
HB: O que significa devolver a confiança?
FV: Junto com a resposta, ele diz o quanto está seguro dela. Se diz “financeiro, 95%”, o sistema segue. Se diz “financeiro, 55%”, o sistema pode pedir confirmação ou mandar para uma pessoa. Um modelo de linguagem responde com a mesma cara quando acerta e quando erra. O Jev não.
Para entender: confiança calibrada. A TypeSafe treina o Jev com um método que chama de RLCD, aprendizado por reforço para decisões calibradas. A ideia é que a probabilidade corresponda à taxa real de acerto: quando o modelo diz 90%, acerta perto de 90% das vezes. Isso permite definir um limiar diferente para cada ação, proporcional ao custo de errar. A calibração é declarada pela empresa e deve ser validada no domínio de cada cliente.
HB: Antes do Jev, como se resolvia esse tipo de decisão?
FV: Havia duas opções. A primeira era expressão regular, que é identificar de forma determinística alguma coisa numa frase. Se tem arroba, é e-mail. Se tem onze dígitos, é telefone. É limitado, porque não dá para mapear tudo o que pode acontecer e colocar em código. A segunda era usar um modelo de linguagem. Ele entende qualquer coisa, mas demora e gasta, sendo que a única coisa que se queria saber era se uma condição aconteceu ou não. O Jev entra nesse meio do caminho. Entende como o modelo de linguagem, custa perto do que custa a expressão regular.
Para entender: expressão regular. Padrão de texto escrito em código que identifica formatos fixos, como um CPF ou um endereço de e-mail. É exato e rápido, mas não interpreta sentido. Não sabe dizer se um e-mail é urgente.
HB: Onde o Jev entra no Orchestra?
FV: Quatro lugares estão mapeados. O primeiro que vou experimentar é o guardrail.
Para entender: guardrail. Camada de verificação que impede um sistema de IA de fazer o que não deve. Pode barrar um comando antes de ele chegar ao modelo, ou barrar uma resposta antes de ela chegar ao usuário.
FV: Todo comando que passar pelo Orchestra vai passar pelo Jev antes de qualquer modelo. Existe uma declaração do que pode e do que não pode. O Jev verifica e devolve a confiança da verificação. É simples de fazer e não interfere no resto do sistema. Por isso vai primeiro.
HB: E os outros três?
FV: Roteamento de modelo. O sistema recebe um comando e o Jev decide qual modelo vai atender. Tarefa direta vai para um modelo rápido e barato. Decisão complexa vai para um modelo mais capaz. Hoje essa escolha ou é fixa ou custa uma chamada a um modelo de linguagem.
Seleção de habilidades. O Orchestra tem dezenas de habilidades, que são pacotes de instruções para tarefas específicas. Para descobrir qual usar, o sistema faz uma chamada. Isso custa dinheiro. Com o Jev, ele indica a habilidade correta e passa direto ao modelo principal. Economiza uma chamada e aumenta a chance de acerto.
E monitoramento. Esse é o que mais muda.
HB: Por quê?
FV: Porque monitoramento não determinístico não era programável. Um pedido como “me avisa quando eu tiver um lead quente no RD Station” não tem regra fixa. O que é quente depende do contexto. Antes, isso exigiria um modelo de linguagem lendo cada mudança, o que é inviável em custo. Agora existe uma camada de monitoramento feita pelo Jev. Ele observa, devolve verdadeiro ou falso, e só se disser que sim um modelo de linguagem é acionado para agir. O Jev funciona antes do modelo, para dizer se ele vai ou não fazer alguma coisa.
Para entender: a cascata. O padrão que emerge nos quatro casos é o mesmo. O Jev decide primeiro, em milissegundos e a custo marginal. O que é simples, o código resolve. O que exige julgamento, um modelo de linguagem resolve. O que exige responsabilidade, uma pessoa resolve. A TypeSafe declara que, em um cenário de um milhão de atendimentos, essa arquitetura custa cerca de 6,5 mil dólares contra 30 mil da arquitetura tradicional. O número é da própria empresa.
HB: Há usos fora do óbvio?
FV: Tem coisas bem inusitadas. Controle de tela, do computador. Como o Jev responde com verdadeiro ou falso, uma nota ou uma escolha entre até 255 opções, dá para escrever um código que, a cada ciclo, envia as opções de onde clicar. O objetivo é “encontre tal coisa na internet”, e a cada passo ele só escolhe onde clicar. Os benchmarks são absurdos. Um modelo de linguagem fazendo isso e o Jev fazendo é infinitamente mais rápido e mais barato. São coisas diferentes.
Para entender: os experimentos da primeira semana. Desenvolvedores publicaram um agente de navegador que reserva um voo em 7,1 segundos a 0,0039 dólar, e um sistema de uso de computador a 0,0002 dólar por decisão. Os próprios autores ressalvam que tudo o que um modelo de fronteira raciocina de graça precisa ser reconstruído em código quando se usa um classificador. Números autodeclarados, sem verificação independente.
HB: Serve para validar um loop. Algo como o auto-research, avaliar se a rodada teve sucesso e, a partir disso, um modelo de linguagem decidir a próxima.
FV: Serve para qualquer coisa que tenha uma condição. Se a rodada teve sucesso ou não é uma pergunta fechada. O Jev responde. Se for muito automatizado, o código resolve a partir dali. Se não, manda-se para um modelo de linguagem decidir o que fazer. Atendimento ao cliente é outro. Chegou uma mensagem, ele roteia para o lugar certo. São infinitos negócios que vão aparecer a partir disso.
HB: Auditoria, contabilidade, pesquisa exploratória em grandes bases de dados.
FV: Grandes bases ele ainda não consegue. A janela de contexto é pequena. Isso deve mudar em breve. Mas é preciso filtrar antes e mandar só o que interessa.
Para entender: janela de contexto. Quantidade máxima de texto que o modelo lê de uma vez. No Jev, 64 mil tokens para o contexto e todas as perguntas somados, com limite de 32 mil para o contexto mais a pergunta mais longa. Um token corresponde a cerca de três quartos de uma palavra em português. A própria TypeSafe alerta que a acurácia cai quando o contexto enche de material irrelevante.
HB: O que ele não faz bem?
FV: Não gera nada. Não escreve, não resume, não explica a decisão. Se a resposta precisa de justificativa, entra um modelo de linguagem depois. E ele lê ao pé da letra. A pergunta tem de estar bem escrita, sem negação, sem duas decisões escondidas na mesma frase. Quem escreve mal a pergunta recebe a resposta errada com confiança alta.
Para entender: o que a TypeSafe publica sobre limitações. A empresa mantém uma página com o que o modelo faz mal: negações e condições implícitas, contagem, comparação de datas, contexto irrelevante, texto escrito para manipular a classificação. A regra que resume tudo: o que o código calcula com exatidão, o código calcula. O modelo entra só no julgamento que o código não consegue formular.
HB: Para um executivo que lê isso, o que fazer?
FV: Olhar as decisões repetitivas da operação e perguntar quantas delas são, no fundo, uma escolha entre poucas opções. Rotear, classificar, aprovar, alertar. Cada uma dessas hoje ou é regra fixa, ou é gente, ou é um modelo de linguagem caro. É ali que um modelo de decisão entra. E testar no tráfego real antes de acreditar nos números do fornecedor. O modelo é barato o bastante para tornar o teste trivial.
HB: É um lançamento que muda o kit de ferramentas?
FV: Ofuscou os outros lançamentos. É uma peça nova. Não é um modelo de linguagem, mas já está dentro do kit. É a peça que faltava.
Ficha técnica
Jev, TypeSafe AI. Lançamento em 15 de setembro de 2026, com aporte de 40 milhões de dólares liderado pelo fundo DCVC. Fundador: Diogo Almeida, ex-OpenAI, coautor do InstructGPT e do RLHF. Três tipos de resposta: escolha entre até 255 opções, nota em escala de 2 a 10 níveis, probabilidade de sim ou não. Latência declarada de 70 a 500 milissegundos. Preço de 0,042 dólar por milhão de tokens de entrada, saída gratuita. Números declarados pela TypeSafe, sem reprodução independente.

