Android

Medium

O texto descreve um sistema chamado 'harness' que avalia modelos de linguagem em termos de precisão e honestidade ao lidar com informações fictícias. O sistema utiliza regras determinísticas para verificar a presença de dados verdadeiros e usa LLMs como juízes para avaliar critérios mais complexos. Testes recentes mostraram que três famílias de modelos, quando confrontadas com uma empresa fictícia chamada 'Acme Holdings', responderam corretamente sem inventar informações falsas.

Compartilhar
Medium
Pressione Enter ou clique para ver a imagem em tamanho completo

Fonte original

Conteúdo traduzido e adaptado pela redação do Notícias Mobile. Confira também a matéria na fonte original.

Leia a matéria completa