Ir para o conteúdo
kapstan
Guia

Modelo de IA próprio: os quatro degraus antes de treinar um, e o teste que diz se você precisa

Quase todo projeto de IA usa modelo pronto, e deveria. Este guia é sobre a minoria em que não dá: o que separa os quatro degraus entre a instrução e o treino, e o teste que diz em qual deles o seu caso mora.

Publicado 19 min de leitura Kapstan

O termo

O que é um modelo próprio, e o que costuma ser vendido como um

Um modelo de IA próprio — custom model — é um modelo treinado no dado da sua empresa, e não um modelo pronto com instruções melhores. A diferença não é de grau: no primeiro caso o julgamento da sua operação entra nos pesos do modelo; no segundo, ele é explicado ao modelo toda vez, em cada pedido.

A confusão tem uma origem comercial e vale nomeá-la. “Treinamos um modelo com os seus dados” é uma frase que descreve, na maior parte das propostas, outra coisa: ligar um modelo pronto aos seus documentos, de modo que ele busque o trecho certo antes de responder. Isso é contexto, resolve a maioria dos casos, é mais barato e é mais fácil de corrigir — e não é treino. A palavra importa porque o que se compra em cada caso é diferente, e o que fica com a empresa também.

O teste rápido para saber qual das duas está na mesa: pergunte o que acontece se um documento mudar amanhã. Se a resposta é “ele passa a considerar o documento novo na hora”, é contexto. Se é “precisamos treinar de novo”, é modelo próprio. As duas respostas são legítimas; a errada é a que não sabe dizer.

A pergunta que abre o assunto não é qual modelo usar, e sim onde mora a resposta certa. Se ela está escrita em algum documento seu, o problema é de busca. Se ela só existe no julgamento de alguém que trabalha aí há anos e nunca a escreveu, o problema é de treino.

Os quatro degraus entre a instrução e o treino

Existem quatro degraus, e eles são cumulativos: instrução, contexto, ajuste fino e treino próprio. Cada um custa mais que o anterior, exige mais que o anterior e resolve uma classe de problema que o anterior não resolve. Subir sem provar que o degrau de baixo falhou é a forma mais comum de gastar caro para resolver o que sairia barato.

Os quatro degraus, o que cada um resolve e o que ele exige
DegrauO que ele resolveO que ele exige
Instrução O modelo não sabia o que você queria: formato, tom, o passo a passo do raciocínio, o que nunca fazer. Alguém que escreva bem a regra e a teste contra casos reais. É o degrau mais subestimado e o que mais devolve.
Contexto O modelo não tinha a informação: manual, histórico do cliente, tabela de preço, norma interna. Ele busca antes de responder. Que a informação exista escrita em algum lugar e esteja organizada o suficiente para ser encontrada.
Ajuste fino O modelo sabe a informação e ainda decide diferente de você — no critério, no formato de saída ou no vocabulário da sua área. Exemplos do julgamento certo, em quantidade e em variedade, com os casos difíceis dentro. Alguém precisa produzi-los.
Treino próprio Nenhum modelo pronto lida com o seu tipo de dado — imagem de inspeção, sinal de sensor, laudo de um domínio que ninguém publicou. Dado em volume, anotação por especialista, e uma equipe que saiba avaliar. É o degrau mais raro e o mais caro.

Os dois primeiros degraus são o que as ferramentas de mercado entregam, e é por isso que a maioria dos casos para neles com razão. O terceiro é a fronteira em que as conversas se confundem: muita coisa vendida como “modelo customizado” é ajuste fino, o que é honesto quando dito com esse nome. O quarto é a exceção, e ele começa muito antes do modelo — começa em descobrir se o dado existe.

Quando

O teste que diz se o seu caso precisa de um

O teste tem uma pergunta só: você já tentou com uma ferramenta pronta, dando a ela toda a informação escrita que existe, e ela continua errando exatamente no caso que importa? Se sim, e se o erro é de julgamento — não de informação faltando —, o seu caso é candidato a modelo próprio.

Três famílias de problema costumam passar nesse teste, e as três têm a mesma característica: o conhecimento que decide nunca foi publicado.

O julgamento que só existe na sua operação. A chapa que só o seu inspetor sabe reprovar, o laudo que só o seu técnico sabe ler, o pedido que o seu analista sabe que vai dar problema antes de dar. Não há manual porque ninguém escreveu — e quando se tenta escrever, o resultado é uma regra que cobre os casos fáceis e falha nos difíceis, que são justamente os que importam.

O vocabulário da sua área. Domínios com linguagem própria, em que a mesma palavra significa outra coisa dentro da empresa, e em que o modelo pronto responde com o sentido do mundo em vez do sentido de casa. Isso às vezes se resolve com instrução; quando o vocabulário é grande e a ambiguidade é sistemática, não se resolve.

O dado que não é texto. Imagem de inspeção, sinal de equipamento, exame, áudio de operação. Aqui não é questão de o modelo pronto decidir diferente: é que o seu problema não é o problema para o qual ele foi construído.

Quando não é — e é o caso da maioria

Se a resposta certa está escrita em algum documento seu, o problema é de busca e não de treino. Três sinais indicam isso com clareza: o erro muda quando você reescreve a instrução, a informação que faltava existe num arquivo, e as exceções são poucas o bastante para caber numa regra.

O primeiro sinal é o mais barato de testar e quase ninguém testa. Pegue os casos em que a ferramenta errou, reescreva a instrução dizendo explicitamente o que ela deveria ter considerado, e rode de novo. Se o erro some, você tem um problema de instrução — e treinar um modelo para resolvê-lo é comprar uma máquina para apertar um parafuso.

O segundo é uma pergunta de arquivo: alguém aí conseguiria responder certo consultando algum documento? Se sim, o trabalho é fazer o sistema consultar esse documento — e a parte difícil passa a ser organizar o que está espalhado, que é um projeto de dado, não de modelo.

O terceiro é de volume. Exceção rara se resolve com regra escrita e com alguém decidindo os casos que escapam. Modelo próprio se justifica quando a exceção é frequente o suficiente para que decidir caso a caso seja o gargalo — e quando ela é variada demais para caber numa lista de regras.

O caminho barato, e por que ele vem antes

Instrução e contexto se corrigem em minutos e não deixam dívida. Um modelo treinado congela um julgamento: quando a regra da sua empresa mudar — e ela muda —, o modelo continua aplicando a antiga até alguém treiná-lo de novo. Isso não desaconselha o treino; deixa claro que ele é infraestrutura, e não um ajuste.

O trabalho

O que o projeto exige, e por que ele começa antes do modelo

Um projeto de modelo próprio é, na maior parte do tempo, um projeto de dado: reunir exemplos do julgamento certo, incluindo os casos difíceis, e marcá-los um a um com a resposta que a sua empresa considera correta. Essa marcação é a anotação, e ela é o trabalho — o treino em si é a parte curta.

Quem anota precisa ser quem sabe julgar. É o inspetor, o técnico, o analista sênior — a mesma pessoa cuja escassez motivou o projeto, o que produz a tensão central desse tipo de trabalho: o insumo é o tempo de quem menos tem tempo. Projetos que ignoram isso terceirizam a anotação para quem não domina o critério e produzem um modelo que aprendeu um julgamento errado, com aparência perfeita.

Duas coisas reduzem esse custo sem estragar o resultado. A primeira é anotar por amostragem dirigida: em vez de marcar tudo, marcar os casos em que o modelo pronto erra e os casos de fronteira — é onde o aprendizado está concentrado. A segunda é dupla checagem apenas nos casos de fronteira, com um terceiro desempate quando os dois especialistas discordam; quando eles discordam muito, a descoberta é outra, e é sobre a empresa: o critério não está fechado nem entre humanos.

Sobre dado de cliente: parte do que se usa costuma ser pessoal, e isso define o desenho do projeto desde o início. Anonimizar antes de anotar, restringir quem acessa, registrar o uso e manter base de treino separada da base de operação são práticas mínimas — e são mais fáceis de fazer no começo que de corrigir depois que o dado já circulou.

Como se sabe que ficou bom

Por um conjunto de avaliação: um lote de casos separado antes do treino, que o modelo nunca viu, com a resposta certa definida pelo seu especialista — e comparado contra um controle, que é o modelo pronto tentando a mesma tarefa. Sem esse conjunto, não há como afirmar que o modelo melhorou; há apenas a impressão de quem o construiu.

O controle é a parte que mais se esquece e a que mais decide. Um modelo próprio que acerta bem, mas acerta o mesmo que um modelo pronto com uma boa instrução, é um projeto caro que produziu um empate. Só a comparação lado a lado responde à pergunta que a empresa está de fato fazendo, que não é “o modelo é bom?” e sim “ele é melhor do que o que eu já conseguiria sem ele?”.

A avaliação também precisa distinguir tipos de erro, porque eles não custam igual. Reprovar uma peça boa e aprovar uma peça ruim têm consequências diferentes na operação; um modelo com o mesmo acerto total pode ser péssimo ou aceitável conforme o lado para o qual ele erra. Essa ponderação é decisão de negócio, e ela precisa estar escrita antes do treino — depois, ela vira justificativa do resultado que saiu.

Monte o conjunto de avaliação antes de treinar qualquer coisa. Ele é o que transforma a conversa de “achamos que ficou melhor” em número, é o que permite trocar de modelo base sem recomeçar, e é o que continua valendo quando sair um modelo novo daqui a alguns meses.

O que fica com a empresa no fim

Três coisas, e não uma: o modelo, o dado anotado e a avaliação. As duas últimas são o que tornam a primeira repetível — o dado anotado é o que permite treinar de novo, e a avaliação é o que diz se o modelo seguinte ficou melhor. Sem elas, a empresa é dona de um arquivo que ninguém sabe se ainda serve.

O dado anotado é o ativo mais durável dos três, e o menos comentado. Modelos base envelhecem depressa: o que era o melhor disponível ano passado hoje é concorrido por opções mais baratas. O seu conjunto anotado não envelhece do mesmo jeito — ele é o julgamento da sua empresa, escrito de uma forma que uma máquina consegue ler, e serve para treinar o modelo seguinte, e o depois dele.

Daí a pergunta de contrato que vale fazer antes de assinar: quem fica com o dado anotado, e em que formato ele é entregue? Fornecedor que entrega o modelo mas retém a base anotada está vendendo um resultado e mantendo a capacidade — e a próxima rodada de treino volta a passar por ele, necessariamente.

Antes de começar

O que se diz por aí e não se confirma

Três afirmações circulam sobre modelo próprio sem apuração que as sustente, e as três fazem o trabalho parecer mais automático do que ele é. O que decide um projeto desses não é o treino: é o dado, a anotação e a avaliação — as três feitas por gente.

Três afirmações que este guia não usa
A afirmaçãoO que a apuração encontrou
“Treinamos um modelo com os seus dados” Na maior parte das propostas, descreve ligar um modelo pronto aos documentos do cliente — o que é contexto, não treino. Legítimo e mais barato; o problema é o nome, porque o que fica com a empresa é diferente nos dois casos.
“Quanto mais dado, melhor” Volume sem variedade e sem anotação confiável não melhora julgamento. Um conjunto menor, com os casos difíceis dentro e marcados por quem sabe julgar, vale mais que um grande e homogêneo.
“O modelo aprende sozinho com o uso” Modelos em produção não incorporam o uso automaticamente. Aprender de novo é um ciclo deliberado — coletar o que ele errou, anotar, treinar, avaliar — e alguém precisa ser dono desse ciclo.

Este guia também não traz estatística de mercado, e a ausência é decisão: os números que circulam sobre ganho de acurácia com ajuste fino e sobre custo médio de projetos de IA não passaram no critério da Kapstan — estudo nomeado, instituição, amostra, data de campo e endereço primário conferido na publicação. Acurácia, além disso, é medida contra um conjunto de teste específico: fora dele, o número não significa nada.

Por onde começar

Comece escrevendo o caso em que a ferramenta pronta erra, monte o conjunto de avaliação antes de treinar qualquer coisa, prove que os degraus baratos não resolvem, e só então trate o treino como projeto — com dono do dado anotado definido em contrato.

  1. Escreva o caso que erra, com exemplos na mão

    Não “ele às vezes erra”: uma pasta com casos concretos, a resposta que veio e a resposta que deveria ter vindo. É esse material que decide o degrau, e ele costuma revelar que os erros são de duas ou três naturezas diferentes — cada uma com solução própria.

  2. Monte o conjunto de avaliação primeiro

    Casos separados que nenhum treino vai ver, com a resposta certa definida pelo seu especialista e com o peso de cada tipo de erro declarado. Sem ele, qualquer resultado depois será uma impressão — e impressão de quem construiu costuma ser generosa.

  3. Prove que instrução e contexto não resolvem

    Rode os dois degraus baratos contra o mesmo conjunto de avaliação e guarde o número. Ele é o controle do projeto inteiro, e é o que permite dizer, no fim, se o modelo próprio ganhou de alguma coisa — ou se apenas empatou por mais dinheiro.

  4. Trate a anotação como o projeto que ela é

    Quem anota, com que critério escrito, quanto tempo por semana, e o que fazer quando dois especialistas discordam. Discordância frequente não é ruído: é a descoberta de que o critério da empresa não está fechado, e isso precisa ser resolvido por gente antes de virar treino.

  5. Defina em contrato de quem é o dado anotado

    Ele é o ativo mais durável do projeto — o que treina o modelo seguinte e o de depois. Quem entrega o modelo e retém a base está vendendo um resultado e mantendo a capacidade; peça também o formato em que ele será entregue.

O vocabulário mínimo

Cinco termos aparecem em toda conversa sobre modelo próprio e quase nunca são definidos por quem os usa. Eles estão aqui com o sentido que este guia lhes dá, e é o mesmo que os outros textos desta série usam.

Modelo base
O modelo pronto de um fornecedor, treinado em dado público e usado como ponto de partida. É o que quase todo projeto de IA usa hoje, e o que resolve a maioria dos casos sem qualquer treino adicional.
Contexto
Dar ao modelo, no momento do pedido, a informação de que ele precisa — buscando o trecho certo nos seus documentos antes de responder. Corrige-se em minutos, acompanha documento que muda, e é o que muita proposta chama de “treinar com os seus dados”.
Ajuste fino
Continuar o treino de um modelo base com exemplos do julgamento da sua empresa, até que ele decida como você decidiria. Serve quando o modelo tem a informação e ainda assim escolhe diferente — no critério, no formato ou no vocabulário.
Anotação
Marcar cada exemplo com a resposta que a sua empresa considera correta. É feita por quem sabe julgar, é a maior parte do custo de um projeto de modelo próprio, e o resultado dela é o ativo que sobrevive à troca de modelo.
Conjunto de avaliação
Um lote de casos separado antes do treino, que o modelo nunca viu, usado para medir se ele melhorou — sempre contra um controle. É o que transforma “achamos que ficou melhor” em número, e o que continua valendo quando sair um modelo novo.

Perguntas frequentes

O que é

O que é um modelo de IA próprio?

É um modelo treinado no dado da sua empresa, e não um modelo pronto com instruções melhores. O julgamento da sua operação entra nos pesos do modelo, em vez de ser explicado a ele em cada pedido. É o quarto degrau de uma escada que começa em instrução e passa por contexto e ajuste fino — e a maioria dos casos para antes dele, com razão.

Qual a diferença entre treinar um modelo e ligar meus documentos a ele?

Ligar os documentos é contexto: o modelo busca o trecho certo antes de responder, acompanha documento que muda no mesmo dia e se corrige em minutos. Treinar é incorporar o julgamento ao próprio modelo, o que exige exemplos anotados e uma nova rodada de treino sempre que a regra mudar. O teste rápido: se um documento mudar amanhã, ele passa a considerar sozinho ou é preciso treinar de novo?

Meu modelo ficaria melhor que um modelo pronto?

Só a comparação diz, e é por isso que ela é obrigatória. A pergunta que a empresa está fazendo não é “o modelo é bom?”, e sim “ele é melhor do que o que eu já conseguiria sem ele?”. Um modelo próprio que empata com um modelo pronto bem instruído é um projeto caro que produziu um empate — e isso só aparece se o controle tiver sido medido.

Como se faz

Quantos exemplos eu preciso ter?

Não há número universal, e quem dá um sem ver o caso está chutando. O que decide é variedade e qualidade da anotação: um conjunto menor, com os casos difíceis dentro e marcados por quem sabe julgar, vale mais que um grande e homogêneo. A régua honesta é o conjunto de avaliação — treina-se, mede-se, e ele diz se falta dado.

Quem anota o dado?

Quem sabe julgar: o inspetor, o técnico, o analista sênior. É a tensão central desse tipo de projeto, porque o insumo é o tempo de quem menos tem tempo. Dá para reduzir o custo anotando por amostragem dirigida — os casos em que o modelo pronto erra e os de fronteira — em vez de marcar tudo.

Posso usar dados de clientes para treinar?

Com cuidado e com desenho definido desde o começo: anonimizar antes de anotar, restringir quem acessa, registrar o uso e manter a base de treino separada da base de operação. A finalidade precisa estar amparada, e o contrato com quem constrói precisa dizer o que acontece com o dado depois. Todas essas decisões são mais baratas no início do que depois que o dado circulou.

Quanto custa e quanto demora?

Depende de uma coisa antes de todas: se o dado já existe anotado, se existe cru, ou se ainda precisa ser criado. Os três cenários têm ordens de grandeza diferentes, e é por isso que não há faixa publicada honesta. O que dá para dizer é onde o tempo vai — anotação e avaliação, quase sempre, e não o treino.

O que preocupa

O modelo aprende sozinho com o uso?

Não. Modelos em produção não incorporam automaticamente o que acontece com eles. Aprender de novo é um ciclo deliberado — coletar os casos em que errou, anotar, treinar, avaliar contra o conjunto separado — e alguém precisa ser dono desse ciclo, com periodicidade definida.

E se sair um modelo novo e melhor daqui a alguns meses?

É o cenário esperado, e é justamente para ele que o dado anotado e o conjunto de avaliação existem. Com os dois na mão, testar o modelo novo é um trabalho curto: mede-se contra o mesmo conjunto e compara-se. Quem tem apenas o arquivo do modelo treinado recomeça a discussão do zero a cada geração.

O que fica comigo no fim?

Três coisas, se o contrato disser: o modelo, o dado anotado e o conjunto de avaliação. As duas últimas são o que tornam a primeira repetível. Fornecedor que entrega o modelo e retém a base anotada está vendendo um resultado e mantendo a capacidade — e a próxima rodada de treino volta a passar por ele, obrigatoriamente.

E se o julgamento dos meus especialistas não bater entre si?

Essa é uma descoberta do projeto, e não um contratempo dele. Discordância frequente entre dois especialistas no mesmo caso significa que o critério da empresa não está fechado — e nenhum modelo resolve isso, porque não há resposta certa para ele aprender. O trabalho, nesse ponto, volta a ser de gente: escolher qual critério vence, escrevê-lo, e só então treinar.

Escrito pela Kapstan, que constrói inteligência artificial aplicada dentro da empresa do cliente — dos degraus baratos ao treino, quando ele é mesmo a resposta. O texto descreve como o trabalho é feito, e não o que a Kapstan vende: o teste dos quatro degraus acima serve para avaliar qualquer proposta, inclusive a dela.

Achou um erro ou uma prática que mudou? Escreva e a correção entra com a data.

Quer descobrir em que degrau o seu caso mora?

A Kapstan constrói dos degraus baratos ao treino de um modelo próprio — com o dado anotado e a avaliação ficando com a sua empresa. A conversa começa por você mostrando o caso em que a ferramenta pronta erra.

Falar com a Kapstan

sem compromisso · 20 min no Google Meet
Guias Kapstan

Produto e marketing com inteligência artificial aplicada.

Os guias explicam o que a Kapstan constrói: atendimento, IA no processo, vídeo, produto e o modelo que só a sua empresa pode ter. Sem venda no meio do texto — o pedido vem no fim, e uma vez só.

kapstan