Excelência Operacional
Disciplina, monitorização e fiabilidade testada em crise como a fundação que qualquer decisão arquitectural tem de respeitar.
A excelência operacional é a parte do trabalho que ninguém põe num diapositivo: disciplina de patching, validação de cópias de segurança, monitorização construída como um sistema e não como um monte de alertas. Num ambiente de produção de gás natural liquefeito não existe nada a que se possa chamar um incidente puramente técnico, e levei uns bons dois anos a acreditar mesmo nisso, em vez de apenas o repetir.
No dia-a-dia significa monitorização proactiva da saúde dos servidores, das mensagens, da replicação e da validação de cópias de segurança. Significa gestão de patches e de mudança em que o plano de recuo existe antes da mudança, e em que alguém perguntou de facto o que é que depende disto. Significa perseguir causas raiz em vez de gerir sintomas, e coordenar entre equipas a uma hora a que ninguém quer estar a coordenar seja o que for. A partir de 2019 a norma passou a ser explícita: zero incidentes de negócio, escrito como compromisso arquitectural e não como indicador operacional.
A crise é onde essa disciplina é auditada, queiramos ou não. Quando o WannaCry apareceu, em Maio de 2017, o programa de patching que eu vinha a construir deixou de ser teoria. Duas frentes ao mesmo tempo: reinícios sequenciados em todo o parque de servidores, e pontos de situação curtos e factuais para as chefias, para que ninguém tivesse de adivinhar o que já estava protegido. Quando uma segunda variante de ransomware apareceu semanas depois, reutilizámos o manual em vez de inventar um novo, e é essa a única razão pela qual foi uma semana má e não um trimestre mau.
A arquitectura que ignora isto não sobrevive ao contacto com a produção. São os diagnósticos de madrugada que permitem desenhar algo que uma equipa consiga mesmo operar.