This post is also available in: English
Otra semana, otra serie de novedades en cloud.
Bienvenidos a la tercera edición de Didgii Weekly Cloud, donde nos enfocamos en los cambios que realmente pueden impactar a quienes diseñamos, administramos y mantenemos infraestructura.
Esta semana tenemos novedades interesantes sobre Kubernetes, recuperación de bases de datos, compatibilidad de Prometheus, seguridad y networking.
Vamos por partes.
Cloud en 60 segundos
AWS presentó Elastic Beanstalk Cluster Mode para ejecutar aplicaciones sobre infraestructura compartida basada en EKS.
AWS GuardDuty amplió sus capacidades de detección y actualizó su agente de seguridad.
Azure anunció un cambio de compatibilidad en PromQL que podría afectar dashboards y alertas.
Google Cloud mejoró los procesos de disaster recovery de Cloud SQL y presentó nuevas opciones de compute.
GKE publicó nuevas versiones de Kubernetes y actualizó sus auto-upgrade targets.
OCI mejoró FastConnect y amplió sus opciones de cifrado con llaves administradas por el cliente.
AWS
Elastic Beanstalk introduce Cluster Mode
Fecha: 17 de septiembre
AWS presentó un nuevo modo de despliegue para Elastic Beanstalk que permite ejecutar múltiples aplicaciones sobre infraestructura compartida basada en Amazon EKS.
En lugar de provisionar infraestructura dedicada para cada aplicación, ahora es posible utilizar recursos compartidos.
El release incluye autoscaling basado en eventos, observabilidad mediante OpenTelemetry, integración con Secrets Manager y HTTPS por defecto.
AWS también presentó una GitHub Action para desplegar aplicaciones directamente desde los repositorios.
¿Por qué importa?
Esto crea un punto intermedio interesante entre un PaaS tradicional y administrar Kubernetes directamente.
Para equipos que operan muchas aplicaciones pequeñas, compartir infraestructura podría reducir costos de compute por aplicación.
Sin embargo, Cluster Mode no significa infraestructura gratuita. AWS cobra los recursos subyacentes, incluyendo EKS y EKS Auto Mode.
Antes de adoptarlo, conviene comparar el costo total y los requisitos operativos con nuestra arquitectura actual.
Fuente oficial: AWS Elastic Beanstalk Cluster Mode
GuardDuty amplía detección de amenazas y actualiza su agente
Fechas: 17–18 de septiembre
Amazon GuardDuty publicó dos cambios relevantes para operaciones.
El 17 de septiembre, AWS documentó que los findings de AI Protection pueden contribuir a la correlación de secuencias de ataque de Extended Threat Detection.
El 18 de septiembre, AWS publicó la versión 1.17.1 de su agente Runtime Monitoring para recursos compatibles de EKS, EC2 y ECS Fargate.
¿Por qué importa?
La detección de amenazas resulta más útil cuando podemos correlacionar findings individuales dentro de una secuencia de ataque.
Para equipos que utilizan GuardDuty Runtime Monitoring, la nueva versión del agente también representa una oportunidad para revisar compatibilidad y versiones desplegadas.
Antes de actualizar, revisa los sistemas operativos soportados y la configuración actual del agente.
Fuente oficial: Amazon GuardDuty — Historial de documentación
Microsoft Azure
Azure Monitor anuncia un cambio importante de compatibilidad en PromQL
Fecha: 17 de septiembre
Microsoft anunció que los regex matchers de PromQL en Azure Monitor Workspace pasarán a utilizar coincidencias completamente ancladas, alineándose con el comportamiento de Prometheus.
Por ejemplo:
kube_pod_container_status_ready{pod=~"frontend"}
Si tu consulta depende de encontrar nombres de pods que simplemente contienen frontend, podría dejar de devolver los resultados esperados.
Para buscar coincidencias parciales, el patrón debería expresarse explícitamente:
kube_pod_container_status_ready{pod=~".*frontend.*"}
¿Por qué importa?
Este cambio puede afectar dashboards, recording rules y alerting rules.
Las consultas que dependan del comportamiento anterior podrían devolver menos series o dejar de encontrar métricas.
Si utilizas Azure Managed Prometheus, vale la pena revisar los regex selectors existentes antes de que entre en vigor el cambio.
Fuente oficial: Azure Observability Blog
Oracle AI Database@Azure agrega integración con Azure Key Vault
Fecha: 15 de septiembre
Oracle Autonomous AI Database sobre Dedicated Exadata Infrastructure ahora soporta Azure Key Vault para las llaves de cifrado que protegen datos en reposo.
Anteriormente, las opciones incluían Oracle Wallet, OCI Vault y Oracle Key Vault.
Esta integración permite administrar las llaves correspondientes directamente desde Azure Key Vault.
¿Por qué importa?
Las arquitecturas multicloud suelen fragmentar los procesos de administración de llaves.
Para organizaciones que ya utilizan Azure Key Vault como estándar, esta integración ofrece otra opción para alinear el cifrado de bases de datos con sus políticas de seguridad.
Fuente oficial: Oracle AI Database@Azure — What's New
Google Cloud
Cloud SQL mejora sus operaciones de disaster recovery
Fecha: 17 de septiembre
Google Cloud modificó la forma en que se habilita point-in-time recovery (PITR) después de operaciones de disaster recovery en Cloud SQL para MySQL y PostgreSQL.
Después de completar un DR switchover o replica failover, PITR ahora se habilita mediante una operación asíncrona independiente.
Anteriormente, este paso podía bloquear la finalización de estas operaciones.
¿Por qué importa?
El tiempo de recuperación es uno de los factores más importantes en database reliability.
Eliminar un paso bloqueante puede ayudar a reducir el tiempo necesario para completar un switchover o failover.
Sin embargo, debemos considerar que PITR se vuelve a habilitar de manera asíncrona al validar nuestros procedimientos de recuperación.
La mejora no elimina la necesidad de probar failover ni de establecer objetivos realistas de RTO y RPO.
Fuente oficial: Cloud SQL release notes
Compute Engine presenta instancias Z4D
Fecha: 17 de septiembre
Google Cloud anunció disponibilidad general de su familia de máquinas Z4D, optimizadas para almacenamiento.
Estas instancias utilizan procesadores AMD EPYC Turin y procesadores Titanium offload.
Google documenta configuraciones con hasta 3 TB de memoria, 42,000 GiB de capacidad local Titanium SSD y 400 Gbps de ancho de banda de red.
¿Por qué importa?
Z4D está orientada a workloads como bases de datos SQL y NoSQL, motores de búsqueda, analytics y sistemas de archivos paralelos.
Para equipos DBRE, una mayor densidad de almacenamiento local puede abrir nuevas posibilidades de performance y optimización de costos.
Pero almacenamiento SSD local no debe confundirse con almacenamiento durable. Las aplicaciones siguen necesitando estrategias de persistencia, replicación y recuperación.
Fuente oficial: Compute Engine release notes
GKE publica nuevas versiones de Kubernetes
Fecha: 17 de septiembre
Google Kubernetes Engine publicó actualizaciones de versiones en sus release channels.
En el Regular channel, Kubernetes 1.35.8-gke.1036000 se convirtió en la versión predeterminada para crear nuevos clusters.
También se publicaron builds adicionales para Kubernetes 1.34, 1.35 y 1.36.
Google actualizó los auto-upgrade targets y marcó un build anterior de 1.36.3 como deprecated.
¿Por qué importa?
Utilizar Kubernetes administrado no elimina la necesidad de gestionar su lifecycle.
Debemos revisar versiones disponibles, maintenance windows, APIs deprecadas y auto-upgrade targets.
Google señala que los rollouts pueden tardar varios días entre regiones y zonas, por lo que la disponibilidad puede variar entre clusters.
Fuente oficial: GKE Regular channel release notes
Oracle Cloud Infrastructure
FastConnect introduce traffic draining
Fecha: 16 de septiembre
OCI FastConnect ahora soporta traffic draining para private virtual circuits en conexiones de partners, conexiones directas y Oracle Interconnects.
Oracle también introdujo mejoras relacionadas con minimum links, interface hold timers y Letters of Authorization para direct cross-connects.
¿Por qué importa?
La conectividad híbrida suele convertirse en una dependencia crítica.
Traffic draining proporciona una capacidad adicional para administrar el tráfico durante cambios de conectividad.
Si utilizas FastConnect, conviene revisar cómo integrar esta funcionalidad con los procedimientos existentes de mantenimiento y failover.
Fuente oficial: OCI FastConnect enhancements
OCI Database with PostgreSQL agrega customer-managed encryption keys
Fecha: 15 de septiembre
OCI Database with PostgreSQL ahora permite utilizar una llave de cifrado propia.
Esto proporciona mayor control sobre la administración de llaves para bases de datos PostgreSQL administradas.
¿Por qué importa?
Las customer-managed keys pueden ayudar a alinear el cifrado de bases de datos con requisitos internos de seguridad y compliance.
Sin embargo, administrar nuestras propias llaves también implica responsabilidades adicionales relacionadas con acceso, lifecycle y disponibilidad.
Fuente oficial: OCI Release Notes
OCI Management Agent recibe actualizaciones de seguridad y compatibilidad
Fecha: 16 de septiembre
Oracle publicó varias mejoras para Management Agent.
El agente ahora incluye su propio Jlinked JDK 21, agrega soporte para Windows Server 2025 e incorpora mejoras en el collector de Log Analytics.
También incluye bug fixes y security fixes.
¿Por qué importa?
Los agentes de administración forman parte de la base operacional de nuestros ambientes cloud.
Mantenerlos actualizados y compatibles ayuda a conservar las capacidades de monitoreo, logging y administración.
Si utilizas OCI Management Agent, revisa las versiones desplegadas y las plataformas soportadas.
Fuente oficial: OCI Management Agent updates
⚠️ Action Required
Revisa tus consultas PromQL en Azure Monitor
El cambio de comportamiento de regex anunciado por Microsoft es el problema de compatibilidad más claro entre las novedades seleccionadas esta semana.
Revisa las expresiones PromQL utilizadas en dashboards, recording rules y alertas que dependan de coincidencias parciales.
Por ejemplo:
pod=~"frontend"
Si necesitas buscar nombres que contengan ese texto, utiliza un patrón explícito:
pod=~".*frontend.*"
No esperes a descubrir que tus dashboards o alertas dejaron de encontrar las series esperadas.
Fuente: Azure Observability Blog
Didgii Take
Esta semana me llaman la atención tres tendencias.
Kubernetes continúa acercándose a experiencias más administradas. Elastic Beanstalk Cluster Mode demuestra cómo AWS está llevando infraestructura basada en Kubernetes a una experiencia de despliegue de aplicaciones más tradicional.
Database reliability sigue mejorando mediante pequeños cambios operacionales. La habilitación asíncrona de PITR en Cloud SQL es un buen ejemplo. No todos los releases importantes necesitan presentar un producto nuevo; algunas veces, eliminar una operación bloqueante es lo que realmente importa.
La compatibilidad de observabilidad merece la misma atención que la compatibilidad de aplicaciones. El cambio de PromQL en Azure nos recuerda que las consultas de monitoreo y las reglas de alerting son dependencias de producción.
Para platform teams, esto significa que nuestras configuraciones de monitoreo deberían estar versionadas, revisadas y probadas igual que el código de las aplicaciones.
¿Qué novedad de cloud te llamó más la atención esta semana?
Comments