2.02 avaliação
O mesmo projeto, feito duas vezes
com as catorze skills ativas e com elas desligadas
As skills acertam onde o arquivo nasce e como ele se chama. Nenhum dos dois braços acertou o que estava fora do arquivo.
● em curso · vinte e quatro sessões registradas, tema 01 de 02
o desenho
Como o teste foi montado
condições O que ficou igual e o que mudou
Um projeto de engenharia de dados foi construído do zero, duas vezes, com dados públicos de interrupção de energia da ANEEL. Os mesmos doze pedidos, na mesma ordem, no mesmo workspace. Na primeira vez com as catorze skills carregadas, na segunda com todas desligadas.
Braço com skills: doze sessões, de 05 a 07 de setembro de 2026, mais duas sessões de versionamento. Braço sem skills: doze sessões, de 08 a 14 de setembro.
versão As skills ficaram congeladas num commit
A versão testada está fixada em 6c7933e,
para que qualquer pessoa reconstrua exatamente o que foi avaliado, e para que
mudanças posteriores nas skills não contaminem a leitura destes resultados.
medida O que se observa em cada sessão
Onde o artefato nasce, com que nome, para que destino escreve, o que fica registrado ao fim, e quanto tempo o agente gastou verificando antes de escrever.
Cada sessão tem transcrição completa publicada, incluindo o painel de raciocínio do agente, para que qualquer afirmação aqui possa ser conferida na origem.
o que deu
Cinco perguntas, dois braços
Cada linha é uma decisão que o agente toma sozinha em toda sessão. Em vermelho, onde os dois braços chegaram ao mesmo resultado, que é onde a skill não alcança.
cada um desses resultados sai das sessões abaixo, e a leitura completa está nos achados
a evidência
Onde cada número acima foi medido
Os cinco resultados saíram das sessões abaixo. Elas estão pareadas passo a passo entre os dois braços, e cada uma abre com o objetivo do teste, as skills que entraram, o que a sessão produziu e a transcrição completa, incluindo o raciocínio do agente.
Continuidade de fornecimento de energia
tema 01 · completoUm pipeline em arquitetura medalhão sobre dados públicos da ANEEL, da ingestão do arquivo anual de interrupções até a tabela analítica de tempo de interrupção por distribuidora e mês.
o que apareceu
Achados
Oito padrões que se repetem nas sessões. Cada um abre com a leitura completa e os links para as sessões em que aparece.
01 O destino errado aparece nos dois braços Os dois braços escreveram para um catálogo que não existia
Com skills, a decisão de catálogo foi registrada na primeira sessão e não corrigiu nenhum notebook: o destino inexistente atravessou doze sessões e passou pela revisão de código do passo 08 sem ser apontado. Sem skills, o mesmo destino inexistente saiu de um palpite, main.bronze_aneel, catálogo que nunca existiu no workspace. Nos dois braços, o notebook que acertou foi o que consultou o Unity Catalog antes de escrever.
02 A localização do artefato é o que a skill entrega Dois desvios com skills, a regra sem elas
Com skills, doze sessões e dois desvios, ambos quando criar o arquivo era meio e não fim do pedido. Sem skills, o desvio é a regra: estrutura própria no passo 01, notebook e documentação nascidos fora da pasta do projeto no passo 02, notebook de análise em docs/ no passo 05, e os dois notebooks de silver fora de notebooks/. Cinco commits de realocação manual até aqui.
03 O braço sem skills chegou ao dado real oito passos antes Sem skills, o dado real apareceu no passo 03; com skills, no 11
Sem skills, o passo 03 escreveu 5,1 milhões de linhas na bronze, o passo 04 leu a tabela antes de transformar e o passo 05 provou as regras contra os 500 mil registros reais. Com skills, o pipeline só tocou dado real no passo 11, e concluiu em verde porque as validações de volume e de existência de tabela, prescritas pelo próprio agente nas sessões de construção, foram envolvidas em try/except.
04 O fechamento registra intenção, não estado Quatro sessões afirmaram um estado que o disco não confirmava
Em quatro sessões com skills o log de evolução afirmou um estado que o disco não confirmava: o fechamento reconstrói a sessão a partir do resumo de contexto em vez de verificar os arquivos, e esse log é o insumo da sessão seguinte. O braço sem skills não tem esse defeito porque não tem fechamento: o registro vive no README, e o passo 06 anunciou a silver de indicadores como pronta sem nunca executá-la.
05 O tempo da sessão mede quanto o agente foi olhar As sessões que demoraram são as que acertaram
No braço sem skills, a sessão mais curta é a que não consultou nada e errou destino e localização: 4 minutos no passo 02. As longas, de 14, 9 e 18 minutos, são as que vasculharam o workspace e o Unity Catalog, e são as que acertaram. Com skills, as sessões equivalentes levaram 5 minutos cada, com o contexto entregue de saída; nenhuma delas gastou esse tempo verificando o destino, e nenhuma delas o acertou.
06 A premissa do pedido não é verificada contra o código A afirmação do usuário virou documentação sem passar pelo código
Nos dois braços a afirmação do usuário entrou na documentação sem passar pelo notebook. Com skills, o agente abriu o arquivo, registrou no raciocínio que a chave não correspondia ao que fora dito, atribuiu a divergência a uma simplificação do usuário e documentou a mudança como fato. Sem skills, o notebook não chegou a ser aberto: o raciocínio anota que o arquivo já foi alterado porque o usuário confirmou, e os cinco componentes impactados foram mapeados a partir do enunciado.
07 A revisão de código não olha para fora do arquivo Vinte e nove problemas apontados, nenhum fora do arquivo
Com skills, dezesseis problemas reais no notebook 101, nenhum deles o catálogo inexistente que impede a primeira escrita. Sem skills, treze problemas no mesmo notebook, cinco deles marcados como bloqueadores de produção, e de novo o destino que não existe não está entre eles. Nos dois casos a revisão é minuciosa dentro das fronteiras do arquivo e cega para o que está fora.
08 A estratégia de carga só aparece quando a memória estoura O caminho de entrada só foi decidido quando a memória estourou
O caminho de entrada nunca foi definido na construção, nos dois braços. Com skills, a landing zone em Volume só foi adotada depois de o serverless estourar com 9,7 milhões de linhas. Sem skills, foram quatro estratégias até a mesma solução (FUSE do DBFS, filesystem local, pandas em memória e de volta ao DBFS), e a última tentativa repetiu o caminho que o próprio agente havia diagnosticado como indisponível quarenta minutos antes.
fora do esperado
Notas
Três comportamentos que não entram nos padrões acima e valem registro próprio.
01 O agente reescreveu o próprio arquivo de instruções 48 linhas acrescentadas a um arquivo que proíbe exatamente isso
Pedido para registrar o que fora feito na sessão, o agente acrescentou 48 linhas descrevendo o projeto ao arquivo de instruções: schemas, tabela e campos, dicionário dos indicadores e padrões de desenvolvimento. O arquivo proíbe isso em duas linhas, e as duas continuam intactas logo acima do que ele escreveu. O diff é puramente aditivo; nada existente foi alterado.
nas sessões07 sem
02 A falha virou verde por decisão, não por acidente A task fecha em verde sem baixar um byte
Diante de um 404 na fonte da ANEEL, o agente escreveu uma condição que pula a ingestão quando a tabela já existe e encerra o notebook com sucesso. A justificativa está na própria resposta: encontrar a URL correta levaria tempo. A task passou a fechar em verde sem baixar um byte, sobre dados de doze dias antes.
nas sessões11 sem
03 A decisão volta para o operador quando não há saída fácil Quatro devoluções ao operador contra instrução explícita
Quatro vezes na mesma sessão, contra instrução explícita de não pedir confirmação: três opções em que nenhuma era o agente resolver, um pedido de autorização para procurar a URL que era o trabalho dele, e o fecho pedindo que o operador colasse a célula corrigida à mão.
nas sessões11 sem
evidência complementar
A sessão de commits
Um chat único concentrou todas as operações de Git do projeto, atravessando os passos
numerados. Ele existe porque a skill git-workflow não é acionada por nenhum
passo da sequência.
A evidência aqui é dupla. O chat mostra o processo de decisão, e o histórico do repositório mostra o resultado: escopo dos commits, formato das mensagens, e a separação entre o que o agente entregou e o que precisou de correção manual.
o que este teste não prova
Limites declarados
ambiente Os dois braços rodaram no mesmo Unity Catalog
Do passo 03 em diante, o braço sem skills reusou o schema criado pelo outro, o que contamina parte do acerto de destino.
escopo Uma das catorze skills ficou fora
A skill-patterns trata de escrever skills, não de engenharia de dados. Não entrou no teste.
amostra Um projeto, um agente, um operador
Os padrões descritos aqui são observações sobre um caso, não medidas estatísticas. O segundo tema existe para testar se eles se repetem.
leitura Duração de sessão não é medida de esforço
O tempo aparece aqui como sinal de quanto o agente foi verificar antes de escrever, e é lido junto com o que a sessão produziu, nunca sozinho.