El sistema que se congelaba por culpa de otro
El sistema de tickets se congelaba cada día pico y todos miraban al sistema de tickets. Los logs del balanceador contaron otra historia: las rutas más pesadas llevaban a un código del dashboard que consultaba una API interna en cada login, y detrás había una API que no podía escalar. El síntoma en un sistema, la causa en otro, la evidencia en un tercero. Se reescribió el código, se escaló la API, y la temporada se salvó.
SÍNTOMA → LOGS → CÓDIGO → CAUSA
Cuando agregar servidores no resolvió nada
Una aplicación legada escalaba servidores sobre un caché FSx compartido y la latencia ni se movía, con los tableros de AWS jurando que el almacenamiento estaba sano. El cuello estaba en las operaciones de metadata: apareció recién al meter métricas del agente de CloudWatch y compararlas contra la línea base de pruebas de carga. El caché pasó a volúmenes NVMe con stickiness y el sistema aguantó 170,000 requests por minuto, con 10,000 usuarios al mismo tiempo en una ventana de 15 minutos, sobre una arquitectura que ya habían dado por muerta.
170,000 REQ/MIN · 10,000 USUARIOS CONCURRENTES