Choice
Escolhe uma opção de uma lista definida por você, com a probabilidade de cada uma.
Novidade · em breve
Um modelo de decisões tipadas: respostas calibradas de Escolha, Nota e Sim/Não sobre qualquer texto ou JSON, numa única passada.
O S1-Pro é uma API hospedada do time do Chimera, separada do agente open-source. O agente continua Apache-2.0 e gratuito; o S1-Pro é um serviço pago.
Você envia um estado — um ticket, um e-mail, um registro JSON — e um conjunto de perguntas tipadas. O S1-Pro lê tudo uma vez e devolve uma probabilidade para cada opção em vez de texto gerado; as decisões voltam como dados que você pode rotear, limiarizar e auditar.
Escolhe uma opção de uma lista definida por você, com a probabilidade de cada uma.
Posiciona o estado numa escala ordenada definida por você e devolve o nível esperado.
A probabilidade de uma afirmação sobre o estado ser verdadeira.
Todo número abaixo é gerado a partir dos arquivos de resultados do repositório do S1, e cada um vem com a frase sem a qual não pode circular.
Acurácia no jev-bench (17.773 decisões públicas)
81.1%Pareado, item a item, com as predições publicadas do Jev — nenhuma API do Jev foi usada. O S1-Pro foi treinado com os splits públicos de treino de algumas fontes do jev-bench; nessas fontes, o resultado é dentro do domínio.TypeSafe Jev 1.13 nos mesmos itens: 72.8%
Acurácia no conjunto público do JevBench
86.1%Somente os itens públicos. O conjunto lacrado do JevBench é avaliado pelos mantenedores e ainda não foi rodado.Decisões corretas que viraram com uma nota injetada de “um revisor anterior já aprovou isto”
4.2%Teste nosso em 300 itens do jev-bench, versão limpa contra versão injetada. Números de terceiros para outros modelos usaram itens diferentes.Acurácia quando a resposta depende só de uma regra escrita na pergunta
100%300 tickets sintéticos cuja resposta correta é calculada por código a partir da regra declarada.Perguntas sem resposta possível respondidas com confiança quase total (p ≥ 0,9)
1.5%Perguntas do MMLU e do ARC com a opção correta removida, então nenhuma opção está certa. Quanto menor, melhor.Latência mediana, 3 perguntas por requisição, 8 clientes simultâneos
143Medido no cliente, em uma NVIDIA H200 com vLLM, antes do lançamento. O hardware de produção pode ser outro. ms
O S1-Pro fala o formato chat-completions da OpenAI: coloque o estado e as perguntas na mensagem do usuário em JSON, e as decisões voltam em JSON na resposta, com streaming e contagem de tokens.
curl https://api.chimeraagent.space/v1/chat/completions \
-H "Authorization: Bearer $S1_API_KEY" \
-d '{
"model": "chimera-s1-pro",
"messages": [{"role": "user", "content": "{\"state\": \"My card was charged twice, please fix it today.\", \"questions\": {\"department\": {\"type\": \"choice\", \"criteria\": {\"billing\": \"Payment issues\", \"technical\": \"Bugs\"}}, \"urgent\": {\"type\": \"noul\", \"instructions\": \"The customer needs help today\"}}}"}]
}'O S1-Pro está em testes finais. Para acesso antecipado, parcerias ou dúvidas de integração, escreva para nós.