Métricas para
AI-driven development

Victor Galvez

Technical Lead, squad de Design System, BCP

Apps para Nueva Zelanda, Canadá, EEUU, África y más Equipos de alto rendimiento con alto impacto en IA
Victor Galvez
Mi historia con las métricas

Cuando llegué al squad de Design System

6 desarrolladores, 8 QEs, 4 o 5 diseñadores

Quería saber qué tan maduro era el equipo

Saqué métricas de donde tenía: el repositorio principal

Dashboards con PRs, líneas de código, commits fuera de horario, horas más productivas

Un ranking, y los lineamientos del banco al lado

Mi historia con las métricas

Lo que me mostró el dashboard

El que más entregaba no era el de más soft skills. Era el más callado.

Buena adopción los primeros meses

El equipo maduró: cada uno sabía qué hacer, conmigo o sin mí

Pero esas métricas no me dicen qué hacen los developers con la IA.

Y entonces

Me preguntaron si era más productivo con IA.

Dije que sí.

No tenía cómo probarlo.

Las herramientas

Le das la tarea completa a un agente

Claude CodeopencodeCursorCodexCopilot

Un PR, un refactor, un fix: el agente lo escribe, lo corre y lo corrige

Tú revisas y diriges

De mecanógrafo a revisor

Métricas de vanidad

Todos ya usan IA. Pero más rápido no es mejor.

01

Líneas de código generadas

02

% de sugerencias aceptadas

03

Tokens consumidos

Suenan bien. No dicen nada.

¿Sirvió?¿Sobrevivió?¿Le dio trabajo a alguien?
El problema

Generar es barato.

Revisar es caro.

El cuello de botella se movió del que escribe el código al que lo revisa.

Las 3 señales

¿Entonces qué importa?

Tres señales. Ninguna mide velocidad.
Las tres miden qué pasa con el código después del merge.

Señal 01 tasa de retrabajo

¿Sobrevive el código?

Código hecho con IA que se reescribe, se parcha o se revierte

Ventana: 2 a 4 semanas después del merge

Comparado con el código hecho a mano

Rehacer no es terminar: es trabajo pendiente disfrazado

Código que se volvió a tocar a 4 semanas del merge Hecho con IA 24% A mano 9% Datos ilustrativos, reemplazar con los tuyos
Señal 02 tiempo de revisión

¿A dónde se fue el tiempo?

Ciclo del PR: del primer commit al merge

Cuánto en escribir, cuánto en revisar, cuántas rondas

Antes y después de usar IA

Si escribir baja y revisar sube igual, no ganaste nada

EscribirRevisar
Antes 12 h 8 h 20 h Con IA 5 h 15 h 20 h Rondas de revisión: 1.4 antes, 2.6 con IA. Datos ilustrativos
Señal 03 bugs que llegaron a producción

¿Qué se rompió después?

Incidentes, hotfixes o bugs en producción

Que salen de un PR hecho con IA

Contra el histórico del equipo

Detecta al revisor que aprueba sin mirar

Incidentes por sprint 048 Histórico del equipo Adopción de IA 7 S1S2S3S4S5 S6S7S8S9S10 Datos ilustrativos
Dos casos mismo ticket, dos semanas, caso ilustrativo

Mismas herramientas, distinto resultado

Día 1
Día 2
Semana 2
Resultado
Dev AEl que parece productivo
PR gigante, sin tests
Aprobado en minutos
Bug en producción. Hotfix. Se reescribe la mitad.
Retrabajo alto. Bugs suben.
Dev BEl que de verdad acelera
Le pide tests y que revise su diff antes del PR
PR chico con tests. Una ronda.
Nadie vuelve a tocarlo
Retrabajo bajo. Bugs igual.

Con las métricas de vanidad gana Dev A. Con las tres señales gana Dev B.

La herramienta: LLMeter

Un proxy y un hook entre el developer y el modelo

Proxy

Cambias la base URL del agente y listo

Cada request queda registrado: quién, qué modelo, tokens, costo, latencia

# Claude Code
export ANTHROPIC_BASE_URL="https://TU_HOST/anthropic"
export ANTHROPIC_AUTH_TOKEN="TU_VIRTUAL_KEY"
claude
Hook

Un script instala hooks en Claude Code y detecta Copilot

Captura la sesión aunque no pase por el proxy

Pantalla Cómo conectarse de LLMeter, con los comandos para Claude Code, opencode, aider, Codex, Cursor y Continue
Lo que ves

Por persona, no solo el promedio del equipo

01

Gasto total de tokens y costo, por persona, modelo y agente

02

Cadencia de cada modelo: requests, latencia, fallos

03

Cuánto contexto da cada developer y cuántas veces reintenta

04

Quién solo pide código y quién también pide tests o revisión

05

Shadow AI: quién no pasa por el proxy

06

Puede avisar si alguien pega una API key o datos de clientes

Vista de LLM Logs de LLMeter con requests, tokens, costo y latencia
Cómo empezar

Tres pasos y un spreadsheet

01

Marca cada PR hecho con IA

02

Pasa el tráfico por un proxy

03

Cruza persona y PR con git y con tus incidentes

Un spreadsheet ya da señal. No hace falta una plataforma.

Cierre

No necesitan LLMeter.

Armen algo parecido, a la medida de su equipo.

Gracias

Victor Galvez

Technical Lead, squad de Design System, BCP