Public Case Subocol - DRP

Sobre el cliente

Subocol es una destacada empresa de base tecnológica orientada a la movilidad y a la gestión de siniestros, especializada en optimizar el flujo de conexión entre aseguradoras, talleres de reparación y proveedores de repuestos. A través de su plataforma insignia Orbika, orquesta de manera inteligente todo el ciclo de reparación de vehículos, reduciendo significativamente el costo medio de los siniestros y elevando la experiencia del asegurado mediante una visibilidad técnica e integral del proceso.

Resumen Ejecutivo

Subocol, compañía líder en la orquestación y digitalización de servicios de reclamación y gestión de siniestros automotrices, requería asegurar la disponibilidad y resiliencia de su plataforma principal, Orbika. Orbika es un ecosistema crítico que conecta en tiempo real a aseguradoras, talleres de reparación y proveedores. Con el fin de mitigar riesgos operativos ante contingencias graves de infraestructura en su región principal, la compañía confió en Clouxter para diseñar y desplegar una arquitectura de Recuperación ante Desastres (DRP) robusta, automatizada y escalable en AWS.

La solución implementada se basó en una estrategia de conmutación multirregión bajo un esquema de reconstrucción rápida a partir de respaldos (Backup & Restore) gestionado íntegramente como Infraestructura como Código (IaC). Utilizando AWS Backup, Amazon ECS (Fargate), AWS Lambda y Amazon Aurora PostgreSQL, Clouxter desplegó un entorno secundario automatizado en otra región de AWS. Esto dotó a Subocol de una capacidad de respuesta inmediata y controlada ante incidentes, protegiendo tanto la persistencia NoSQL como relacional de su negocio y alineándose con las mejores prácticas internacionales de resiliencia en la nube.

El desafío

La plataforma digital de Subocol, Orbika, soporta procesos core del negocio cuya inactividad representa graves consecuencias operativas y financieras para el ecosistema de seguros. El desafío técnico radicaba en que el entorno productivo de Orbika requería una estrategia de recuperación ante desastres (DRP) que garantizara que, ante fallas críticas a nivel de infraestructura, conectividad regional o incidentes graves de disponibilidad, el servicio pudiese ser restablecido de forma segura y consistente con el menor impacto operativo posible.

De no abordarse este requerimiento, Subocol se enfrentaba a riesgos sustanciales: interrupción de la comunicación en línea entre talleres y aseguradoras, demoras críticas en la compra y despacho de autopartes, potencial pérdida de integridad en la información de siniestros y el consecuente incumplimiento de Acuerdos de Nivel de Servicio (SLA) con clientes corporativos. Adicionalmente, el proceso de conmutación (switchover) y retorno a la normalidad (rollback) debía ser predecible, rápido y auditable, eliminando los errores comunes de las ejecuciones manuales bajo presión.

La Solución

Clouxter implementó para Subocol un plan de DRP robusto que opera bajo el enfoque de reconstrucción mediante copias de seguridad activas en una región secundaria (us-east-2), usando como origen la cuenta productiva principal de Orbika (us-east-1). La totalidad de la infraestructura de red, seguridad y cómputo se definió como código (IaC) utilizando Terraform, mientras que la configuración y replicación de los respaldos cruzados se orquestó mediante AWS CDK. Esta dualidad tecnológica permitió a Subocol recrear entornos idénticos y consistentes de forma automática ante una declaración de desastre.

La arquitectura y los servicios core implementados para el DRP se detallan a continuación:

  1. Almacenamiento y Replicación Cross-Region: Se configuró AWS Backup para gestionar la política centralizada de copias de seguridad de las bases de datos relacionales y de la información operativa. Utilizando claves cifradas con AWS KMS, los respaldos se replican de manera segura de forma cruzada hacia la cuenta y región del DRP.
  2. Persistencia de Base de Datos: Para la base de datos relacional principal, se implementó Amazon Aurora PostgreSQL (con despliegue Multi-AZ en producción), cuyos snapshots se replican a la región secundaria para ser restaurados bajo demanda durante el DRP. Para los datos no relacionales, la información en Amazon DynamoDB se respalda y restaura de forma ágil en la cuenta de DRP a través de flujos automatizados utilizando funciones AWS Lambda.
  3. Capa de Cómputo y Microservicios: La lógica de la aplicación se ejecuta en microservicios orquestados en Amazon ECS (Fargate). El uso de tecnología serverless para contenedores evita tener que pagar por infraestructura encendida de forma ociosa en la región secundaria, permitiendo aprovisionar el clúster de ECS bajo demanda con recursos listos únicamente durante la conmutación.
  4. Enrutamiento y Redirección: En la capa de distribución, se utiliza Amazon CloudFront con alias públicos. Ante un evento de DRP, los registros DNS se actualizan de forma automatizada redirigiendo el tráfico del frontend y del backend expuesto vía Amazon API Gateway hacia la infraestructura de contingencia sin impactar la experiencia de usuario.
  5. Monitoreo y Parametrización: Las variables de entorno de la solución se desacoplaron del código empleando AWS Systems Manager Parameter Store, asegurando que el entorno de DRP obtenga sus propios endpoints y secretos dinámicamente. Toda la traza, logs y ejecución de tareas de DRP se supervisan mediante Amazon CloudWatch y orquestadores AWS Step Functions.

Resultados y Beneficios

El despliegue de la estrategia de Recuperación ante Desastres (DRP) por parte de Clouxter transformó radicalmente la postura de resiliencia operativa de Subocol. La implementación de un entorno seguro y automatizado garantizó la continuidad del negocio para su plataforma Orbika sin comprometer la eficiencia operativa ni financiera, con el pago por uso real y garantizando la continuidad del negocio sin afectar la operación diaria.

Principales Beneficios y Resultados

  • Alta Resiliencia Operativa: Arquitectura Multi-Región en AWS diseñada para soportar la operación crítica ante contingencias mayores, reduciendo al mínimo el riesgo de indisponibilidad del servicio.
  • Eficiencia en Costos: Estrategia basada en Infraestructura como Código (IaC) y arquitectura serverless en la región secundaria, pagando un 0% de cómputo inactivo y activando costos solo durante pruebas o eventos de recuperación reales.
  • RTO y RPO Garantizados: Definición e implementación de Objetivos de Tiempo (RTO) y Punto de Recuperación (RPO) alineados con las exigencias del negocio. Reemplazo de esquemas manuales por procesos 100% automatizados,con tiempos de restablecimiento predecibles y medibles.
  • Conmutación Automatizada y Repetible: 100% de eliminación de desconfiguraciones y errores manuales entre regiones mediante la estandarización y aprovisionamiento automatizado con Terraform y AWS CDK.
  • Integridad y Gobierno de Datos: Protección integral de bases de datos relacionales y no relacionales mediante replicación cross-region y cifrado de extremo a extremo con AWS KMS. Incluye políticas centralizadas de retención y la continuidad de la conectividad híbrida para talleres y aseguradoras.
  • Validación sin Impacto Operativo: Reducción de hasta un 90% en el tiempo necesario para realizar simulacros de DRP, permitiendo ejecutar pruebas periódicas y controladas con 0% de impacto o interrupción en las operaciones de producción.