GCP

GCP

GCP

Cloud TPU: Long-Context Multimodal Embedding Inference with TPU-Aware vLLM Optimizations

Google shows vLLM TPU optimizations—tensor alignment, JAX/XLA pre-warming, and StepPool scheduling—enabling 10–15k token embedding inference on Cloud TPU.

Sep 1, 2026·3mgcpcloud-tpu
GCP

GKE gVisor sandbox integration for Ray clusters (experimental)

GCP's experimental gVisor sandbox integration for Ray on GKE enables high-density process isolation for GPU-backed agentic and multi-tenant inference workloads.

Aug 31, 2026·3mgkegvisor
GCP

Gemini Omni 1.1 Flash GA: token prices, Vertex AI/Agent tiers, and Cloud Run always‑on costs that reshape AI architecture

Gemini Omni 1.1 Flash GA reveals per-token prices and Vertex AI/Agent tiers; with Cloud Run always-on costs, this shifts architecture and cost trade-offs.

Aug 30, 2026·3mgeminicloud-run
GCP

Google Gemini 3.7 Flash GA — limited introductory pricing and platform implications

Gemini 3.7 Flash GA arrives with a limited introductory pricing window; platform teams should validate agents and instrument token costs before rates increase.

Aug 29, 2026·3mgemini-3-7vertex-ai
GCP

Cloud Run sandboxes public preview, GHCR import; GKE gateway authz preview; Gemini Flash 2027 price increase

Cloud Run sandboxes enter public preview with GHCR import; GKE adds gateway-level authz preview for GKE 1.36+; Gemini Flash models face a 2027 price increase.

Aug 27, 2026·3mcloud-rungke
GCP

Gemini Enterprise: GA agent registration (A2A/A2UI), mobile Flash toggle, and project-level pay-as-you-go

Gemini Enterprise adds GA agent registration for agent-to-agent and agent-to-UI, a mobile Gemini Flash admin toggle, and project-level pay-as-you-go metering.

Aug 26, 2026·3mgoogle-cloudgemini-enterprise
GCP

Cloud Run GA: migrate App Engine Java standard images to containers; BigQuery adds Gemini Flash integrations

Cloud Run GA migrates App Engine Java standard images to containers without rebuilds; BigQuery adds Gemini Flash and limits some graph features to higher tiers.

Aug 25, 2026·3mcloud-rungemini-flash
GCP

Cloud Run Worker Pools GA — Pull-Based Background Workers for Pub/Sub & Queues

Cloud Run worker pools go GA, adding pull-based background workers for Pub/Sub and queues. Also note Gemini model previews, retirements, and GKE CNI changes.

Aug 24, 2026·3mcloud-runvertex-ai
GCP

Gemini Flash GA: Gemini API, Enterprise Agent Platform, and BigQuery in-database inference

Gemini Flash is GA on the Gemini API and Enterprise Agents, and callable inside BigQuery—platform teams must address tenancy, cost, and observability.

Aug 22, 2026·3mgemini-flashgemini-api
GCP

GKE 1.36: Autopilot Arm ComputeClasses (autopilot-arm, autopilot-arm-spot) for mixed Arm/x86 clusters

GKE 1.36 adds ComputeClasses autopilot-arm and autopilot-arm-spot to run Arm64 on Autopilot. Platform teams must handle multi-arch CI, builds and cost tracking.

Aug 21, 2026·3mgkeautopilot
GCP

Gemini 3.7 Flash Intro Pricing, Gemini Enterprise Pay-as-you-go, and Cloud Run functions for pipelines

Gemini 3.7 Flash has introductory pricing through Dec 31, 2026; Google adds Gemini Enterprise pay-as-you-go and favors Cloud Run functions for ingestion.

Aug 20, 2026·3mgemini-3-7-flashgemini-enterprise
GCP

Cloud Run Worker Pools on GCP: always-on execution for pull-based, non-HTTP workloads

Cloud Run worker pools enable always-on, pull-based execution for queue consumers and background inference. Service Health GA brings instance-level multi-region failover.

Aug 18, 2026·3mgoogle-cloudcloud-run
61 more