This post is also available in: English
Otra semana, otra larga lista de novedades en cloud.
En lugar de intentar cubrir cada anuncio publicado por AWS, Azure, Google Cloud y Oracle, en Didgii Weekly Cloud nos quedamos con los cambios que realmente pueden tener impacto para quienes operamos infraestructura.
Esta edición cubre del 8 al 14 de septiembre de 2026.
Cloud en 60 segundos
Lo más importante:
AWS Systems Manager ahora puede diagnosticar más causas por las que una instancia EC2 no aparece correctamente administrada.
CloudWatch Network Monitoring mejora la visibilidad de conexiones Transit Gateway entre regiones.
Azure Copilot Troubleshooting Agent llegó a disponibilidad general.
Azure fortaleció la seguridad de SAS tokens y amplió la administración de infraestructura distribuida con Azure Arc.
Cloud Run permite retrasar jobs no urgentes para optimizar costos.
Google mejoró Cloud Monitoring, Cloud SQL y el ciclo de versiones de GKE.
OCI Cache agregó replicación entre regiones.
Oracle Cloud Migrations ahora soporta migraciones desde instancias AWS EC2 basadas en ARM.
AWS
Systems Manager mejora el diagnóstico de instancias EC2 no administradas
Estado: GA
Fecha: 9 de septiembre
AWS Systems Manager ahora puede identificar más problemas que impiden que una instancia EC2 o un nodo híbrido sea administrado correctamente.
Además de conectividad, puede diagnosticar problemas relacionados con:
permisos IAM
versión de SSM Agent
EC2 status checks
configuración del sistema operativo
Default Host Management Configuration
hybrid activation
¿Por qué importa?
Una instancia que deja de estar administrada por Systems Manager pierde capacidades importantes como:
EC2 no administrado
|
+--> Session Manager
+--> Run Command
+--> Patching
+--> Inventory
Encontrar manualmente si el problema está en IAM, networking, el agente o el sistema operativo puede llevar bastante tiempo.
Obtener directamente una causa concreta convierte un problema muy abierto en uno mucho más fácil de investigar.
Fuente oficial:
AWS Systems Manager
CloudWatch mejora troubleshooting de Transit Gateway entre regiones
Estado: GA
Fecha: 10 de septiembre
CloudWatch Network Monitoring ahora puede proporcionar un Network Health Indicator para conexiones que atraviesan un Transit Gateway inter-Region peering.
¿Por qué importa?
Cuando aparece latencia o packet loss entre regiones, una de las primeras preguntas es:
¿El problema está en nuestra aplicación, en nuestra red o en la infraestructura de AWS?
El nuevo indicador agrega una señal adicional para identificar cuándo la degradación pertenece al path administrado por AWS.
También puede utilizarse en dashboards y alarms de CloudWatch.
Fuente oficial:
Amazon CloudWatch Network Monitoring
AWS DevOps Agent agrega comunicación bidireccional desde Slack
Estado: GA
Fecha: 11 de septiembre
AWS DevOps Agent ahora puede utilizarse directamente desde canales privados conectados de Slack.
Los ingenieros pueden iniciar y dirigir investigaciones mencionando al agente dentro de la conversación.
¿Por qué importa?
Durante un incidente normalmente saltamos entre:
Slack
CloudWatch
AWS Console
Logs
Dashboards
Deployments
Tickets
Reducir context switching puede ser útil durante incidentes de alta severidad.
Pero las preguntas importantes continúan siendo las mismas: qué permisos tiene el agente, qué acciones puede ejecutar y cómo se auditan sus recomendaciones.
Fuente oficial:
AWS DevOps Agent
Microsoft Azure
Azure Copilot Troubleshooting Agent llega a GA
Estado: GA
Fecha: 9 de septiembre
Microsoft anunció disponibilidad general del Troubleshooting Agent de Azure Copilot.
El objetivo es ayudar a investigar problemas utilizando contexto real de los recursos y herramientas de diagnóstico de Azure.
¿Por qué importa?
Troubleshooting normalmente significa correlacionar:
Metrics
Logs
Events
Configuration
Dependencies
Recent changes
Un agente capaz de trabajar sobre ese contexto puede ayudar a reducir el tiempo inicial de una investigación.
No sustituye buenas métricas, logs, traces ni conocimiento técnico.
Pero sí puede convertirse en una herramienta adicional para reducir MTTR.
Fuente oficial:
Azure Copilot Troubleshooting Agent
User-bound User Delegation SAS llega a GA
Estado: GA
Fecha: 9 de septiembre
Azure Storage ahora permite ligar un User Delegation SAS a una identidad específica de Microsoft Entra ID.
¿Por qué importa?
Tradicionalmente, si alguien obtiene un SAS válido, puede utilizarlo mientras el token continúe vigente y dentro de sus permisos.
Ahora podemos introducir una condición adicional:
SAS
+
Identidad Entra ID
|
v
Acceso
Esto reduce el impacto de un SAS token expuesto accidentalmente.
Para storage con acceso temporal o delegado, es una mejora de seguridad bastante interesante.
Fuente oficial:
Azure Storage announcement
Azure Local workload management entra en Public Preview
Estado: Public Preview
Fecha: 10 de septiembre
Azure Arc Site Manager ahora puede mostrar y administrar centralmente máquinas virtuales y Kubernetes clusters ejecutándose sobre Azure Local.
También soporta operaciones bulk sobre diferentes workloads.
¿Por qué importa?
La infraestructura distribuida suele organizarse físicamente:
Datacenter
Factory
Branch
Retail Store
y no necesariamente utilizando la misma jerarquía con la que pensamos en subscriptions y resource groups.
Organizar operaciones alrededor del concepto de Site tiene bastante sentido para edge y hybrid cloud.
Fuente oficial:
Azure Arc Site Manager preview
Workload Orchestration llega al portal de Azure
Estado: Disponible
Fecha: 10 de septiembre
Microsoft también facilitó el onboarding de Workload Orchestration desde Azure Portal.
La tecnología busca administrar despliegues consistentes sobre Kubernetes distribuido utilizando principios de GitOps y configuración específica por ubicación.
¿Por qué importa?
El reto no es instalar una aplicación una vez.
El reto real aparece cuando tenemos:
App
|
Desired State
|
+-------+-------+
| | |
Site A Site B Site C
| | |
config config config
Mantener consistencia sin perder personalización por site es uno de los principales problemas del edge computing.
Fuente oficial:
Azure Workload Orchestration
Workload Orchestration llega al portal de Azure
Fecha: 10 de septiembre
Microsoft también facilitó el onboarding de Workload Orchestration desde Azure Portal.
La tecnología busca administrar despliegues consistentes sobre Kubernetes distribuido utilizando principios de GitOps y configuración específica por ubicación.
¿Por qué importa?
El reto no es instalar una aplicación una vez.
El reto real aparece cuando tenemos:
App
|
Desired State
|
+-------+-------+
| | |
Site A Site B Site C
| | |
config config config
Mantener consistencia sin perder personalización por site es uno de los principales problemas del edge computing.
Fuente oficial:
Azure Workload Orchestration
Google Cloud
Cloud Run permite retrasar jobs para reducir costos
Estado: Preview
Fecha: 8 de septiembre
Cloud Run ahora permite retrasar la ejecución de jobs no urgentes hasta 12 horas para aprovechar precios reducidos.
¿Por qué importa?
No todos los jobs necesitan ejecutarse inmediatamente.
Puede funcionar muy bien para:
procesamiento batch
reportes
cleanup
transformación de datos
analytics
cargas asincrónicas
Si podemos intercambiar tiempo por precio, tenemos una nueva herramienta de FinOps sin rediseñar completamente el workload.
Fuente oficial:
Cloud Run release notes
Cloud Monitoring permite diferentes time ranges por gráfica
Estado: GA
Fecha: 9 de septiembre
Cada chart de un dashboard de Cloud Monitoring puede ahora sobreescribir el rango de tiempo global.
¿Por qué importa?
Un dashboard operativo puede necesitar mostrar al mismo tiempo:
Errores → 1 hora
CPU → 30 minutos
Deployments → 24 horas
Capacity trend → 30 días
Obligar a todas las gráficas a compartir la misma ventana no siempre tiene sentido.
Es un cambio pequeño, pero útil para observabilidad real.
Fuente oficial:
Cloud Monitoring release notes
Cloud SQL agrega regional endpoints para su Admin API
Estado: GA
Fecha: 8 de septiembre
Los Regional Endpoints para Cloud SQL for MySQL Admin API llegaron a disponibilidad general.
¿Por qué importa?
Es especialmente relevante para organizaciones con requisitos de:
residencia de datos
soberanía
límites regionales
controles estrictos de red y API
No todos los equipos lo necesitan, pero para ambientes regulados puede ser una capacidad importante.
Fuente oficial:
Google Cloud Release Notes
Observability API soporta VPC Service Controls
Estado: GA
Fecha: 8 de septiembre
Google Cloud agregó soporte de VPC Service Controls para Observability API.
¿Por qué importa?
Si protegemos nuestros servicios críticos utilizando service perimeters, observabilidad no debería convertirse en una excepción.
Extender VPC Service Controls ayuda a reducir riesgo de data exfiltration en ambientes con controles estrictos.
Fuente oficial:
Google Cloud Observability release notes
GKE actualiza el Regular release channel
Fecha: 8 de septiembre
Google publicó nuevos builds para GKE Regular channel.
Entre los cambios:
1.35.7-gke.1222000pasa a ser default para nuevos clusters.1.35.8-gke.1036000queda disponible.1.36.3-gke.1767000queda disponible.otro build
1.36.3entra en proceso de deprecación dentro del channel.
¿Por qué importa?
Utilizar Kubernetes administrado no significa olvidarnos completamente del lifecycle.
Tenemos que seguir vigilando:
Current
|
v
Available
|
v
Auto-upgrade target
|
v
Deprecated
|
v
Unsupported
Fuente oficial:
GKE Regular channel release notes
Oracle Cloud Infrastructure
OCI Cache agrega cross-region replication
Estado: GA
Fecha: 9 de septiembre
OCI Cache ahora puede replicar datos de manera asíncrona desde un cluster primario hacia otro cluster localizado en una región diferente.
¿Por qué importa?
Oracle lo orienta a:
disaster recovery
aplicaciones globales
migraciones planificadas entre regiones
La arquitectura puede verse así:
Region A
|
Primary Cache
|
| async
v
Secondary Cache
|
Region B
Esto puede reducir significativamente el tiempo necesario para levantar una aplicación en otra región después de una falla.
Como la replicación es asíncrona, RPO y replication lag continúan siendo consideraciones importantes.
Fuente oficial:
OCI Cache cross-region replication
Oracle Cloud Migrations soporta AWS EC2 ARM
Estado: GA
Fecha: 9 de septiembre
Oracle Cloud Migrations ahora puede migrar instancias soportadas de AWS EC2 basadas en ARM hacia OCI Compute.
Durante discovery, Oracle identifica la arquitectura y utiliza esa información para recomendar shapes e imágenes compatibles.
¿Por qué importa?
Con la adopción de AWS Graviton, muchas organizaciones ya tienen ambientes mixtos:
AWS Estate
|
+-- x86
|
+-- ARM / Graviton
Las herramientas de migración multicloud tienen que entender esa diferencia.
No podemos simplemente asumir que cualquier VM puede moverse hacia cualquier shape.
Fuente oficial:
Oracle Cloud Migrations ARM support
Grok 4.6 llega a OCI Generative AI
Estado: On-demand
Fecha: 10 de septiembre
OCI Generative AI agregó xAI Grok 4.6, orientado a coding, agentic workloads y knowledge work.
Soporta un contexto de hasta 500,000 tokens.
¿Por qué importa?
Más que el modelo específico, me parece interesante la tendencia.
Los hyperscalers están convirtiendo sus plataformas AI en plataformas multi-modelo.
Eso significa que platform engineering tendrá que tratar los modelos como otro recurso administrado:
Model
|
+-- IAM
+-- Cost
+-- Quotas
+-- Regions
+-- Observability
+-- Governance
+-- Lifecycle
Fuente oficial:
OCI Generative AI Grok 4.6
Didgii Take
Esta semana veo tres tendencias especialmente interesantes.
Troubleshooting se está convirtiendo en un servicio administrado
AWS Systems Manager y Azure Copilot están atacando desde ángulos diferentes una parte importante del trabajo de SRE.
Normalmente hacemos:
Alert
|
Metrics
|
Logs
|
Events
|
Configuration
|
Changes
|
Hypothesis
|
Root Cause
Los proveedores quieren ayudar con esa correlación.
Puede reducir MTTR, pero no deberíamos confundir AI-assisted troubleshooting con una estrategia de observabilidad.
Sin buena telemetría, el agente tampoco tendrá suficiente contexto.
Multi-region ya no termina en la base de datos
OCI Cache cross-region replication es otro recordatorio de que disaster recovery tiene que considerar todas las dependencias.
Una aplicación realmente multi-region probablemente necesita revisar:
database
cache
storage
queues
container registry
secrets
configuration
networking
Mover compute a otra región sirve de poco si una dependencia crítica continúa disponible únicamente en la región que falló.
Cada vez dependemos menos de credenciales bearer
La evolución de User Delegation SAS en Azure sigue una dirección similar a lo que vimos la semana pasada con Cloud SQL.
Pasamos de:
Tengo el secret
|
v
Tengo acceso
hacia:
Credential
+
Identity
+
Policy
+
Context
|
v
Access
Es una evolución positiva para seguridad, revocación y auditoría.
⚠️ Action Required
Esta semana no encontré entre los anuncios seleccionados una deprecación crítica multi-cloud que justifique crear urgencia artificial.
Pero si administras clusters GKE Regular, sí revisaría las versiones actuales y los auto-upgrade targets.
Google agregó nuevas versiones y marcó uno de los builds 1.36.3 como deprecated dentro del channel.
Fuente:
GKE Regular channel release notes
Worth Watching
Mi release favorita de esta semana probablemente es la menos espectacular:
Systems Manager diagnosticando EC2 unmanaged instances.
Porque resuelve un problema real.
Hay una diferencia enorme entre:
“SSM no funciona, revisemos todo.”
y:
“SSM no funciona porque esta instancia tiene un problema específico de IAM.”
Ese tipo de mejora puede ahorrar mucho más tiempo operacional que algunas funcionalidades bastante más llamativas.
¿Qué novedad te pareció más interesante esta semana?
Comments