Victor Galvez
Technical Lead, squad de Design System, BCP

6 desarrolladores, 8 QEs, 4 o 5 diseñadores
Quería saber qué tan maduro era el equipo
Saqué métricas de donde tenía: el repositorio principal
Dashboards con PRs, líneas de código, commits fuera de horario, horas más productivas
Un ranking, y los lineamientos del banco al lado
El que más entregaba no era el de más soft skills. Era el más callado.
Buena adopción los primeros meses
El equipo maduró: cada uno sabía qué hacer, conmigo o sin mí
Pero esas métricas no me dicen qué hacen los developers con la IA.
Me preguntaron si era más productivo con IA.
Dije que sí.
No tenía cómo probarlo.

Un PR, un refactor, un fix: el agente lo escribe, lo corre y lo corrige
Tú revisas y diriges
De mecanógrafo a revisor
Todos ya usan IA. Pero más rápido no es mejor.
Líneas de código generadas
% de sugerencias aceptadas
Tokens consumidos
Suenan bien. No dicen nada.

Generar es barato.
Revisar es caro.
El cuello de botella se movió del que escribe el código al que lo revisa.
¿Entonces qué sí importa?
Tres señales. Ninguna mide velocidad.
Las tres miden qué pasa con el código después del merge.
Código hecho con IA que se reescribe, se parcha o se revierte
Ventana: 2 a 4 semanas después del merge
Comparado con el código hecho a mano
Rehacer no es terminar: es trabajo pendiente disfrazado
Ciclo del PR: del primer commit al merge
Cuánto en escribir, cuánto en revisar, cuántas rondas
Antes y después de usar IA
Si escribir baja y revisar sube igual, no ganaste nada
Incidentes, hotfixes o bugs en producción
Que salen de un PR hecho con IA
Contra el histórico del equipo
Detecta al revisor que aprueba sin mirar


Con las métricas de vanidad gana Dev A. Con las tres señales gana Dev B.
Cambias la base URL del agente y listo
Cada request queda registrado: quién, qué modelo, tokens, costo, latencia
# Claude Code export ANTHROPIC_BASE_URL="https://TU_HOST/anthropic" export ANTHROPIC_AUTH_TOKEN="TU_VIRTUAL_KEY" claude
Un script instala hooks en Claude Code y detecta Copilot
Captura la sesión aunque no pase por el proxy

Gasto total de tokens y costo, por persona, modelo y agente
Cadencia de cada modelo: requests, latencia, fallos
Cuánto contexto da cada developer y cuántas veces reintenta
Quién solo pide código y quién también pide tests o revisión
Shadow AI: quién no pasa por el proxy
Puede avisar si alguien pega una API key o datos de clientes

Marca cada PR hecho con IA
Pasa el tráfico por un proxy
Cruza persona y PR con git y con tus incidentes
Un spreadsheet ya da señal. No hace falta una plataforma.
No necesitan LLMeter.
Armen algo parecido, a la medida de su equipo.

Gracias
Victor Galvez
Technical Lead, squad de Design System, BCP