自研資料平面取代 Envoy、TPU 嵌入推論與雙架構處理器:三則基礎設施工程進展
Stripe Engineering Blog · 2026-08-26
Stripe:用 Go 重寫服務網格資料平面
Stripe 於 8 月 26 日在工程部落格公開自研的分散式代理伺服器 mesh-proxy,用以取代服役近十年的 Envoy。問題出在 Envoy 的 worker 執行緒模型:每個 worker 會為每個上游端點各自建立一條連線,當一顆 CPU 對應一個 worker、且服務需承接整個機群的請求時,連線數會累積到數十萬條並引發過載事故。文章也提到一次 nghttp2 升級新增的 HTTP/2 DDoS 防護,曾在測試中意外擋下部分合法流量,既有架構也難以為 Ruby 服務客製化路由邏輯。
mesh-proxy 以 Go 撰寫,核心差異在於每條連線配一組讀寫 goroutine,把多個請求多工到共用連線上,取代 Envoy 依 worker 切分連線的做法,並直接對接 Stripe 自家的服務註冊系統而非採用 xDS。它自行實作 HTTP/1.1 與 HTTP/2 協定處理,並內建重試、請求對沖(hedging)、限流與依優先權路由等功能。
Stripe 表示其公開 API 的可靠度目標為 99.9995%,目前處理的交易額約當全球 GDP 的 1.6%。換上 mesh-proxy 後,團隊量測到的改善幅度如下:
- 高負載下 CPU 使用量降低約 50%
- 服務間延遲降低約 50%,換算下來每天省下約 3,000 天的累計跨服務延遲
- Ruby 基礎設施流量突發時多出 15–20% 的餘裕空間
Google Cloud:讓 vLLM 原生跑在 TPU 上做長文本嵌入推論
Google 同樣在 8 月 26 日於開發者部落格說明如何把開源推論引擎 vLLM 原生整合進 Cloud TPU,鎖定長文本、多模態的嵌入(embedding)推論場景。整合對象是 Qwen3 嵌入模型家族:純文字的 Qwen3-Embedding-8B 可處理最長 16,384 token 的輸入,多模態版本 Qwen3-VL-Embedding-8B 則支援超過 15,000 token 的圖文混合輸入,運算層採用 TPU Ironwood 拓樸並搭配張量平行(tensor parallelism)設定。
文章著墨在數值精度上:模型以 bfloat16 執行,並要求輸出與參考基準的一致性達到嚴格門檻。驗證標準是純文字輸出的餘弦相似度(cosine similarity)需 ≥0.999、多模態輸出需 ≥0.995,同時要處理張量切分時的硬體對齊、模型延遲載入初始化,以及用分塊(chunked)prefill 因應超長上下文的記憶體限制。效能面公布的數字是文字嵌入吞吐量達每秒 83,996 個 token、每秒 5.13 個請求。
IBM:處理器核心原生同時執行 Arm 與 Z 指令集
IBM 在 8 月 24 日的新聞稿中,發表用於未來 IBM Z 與 LinuxONE 平台的下一代雙架構(dual-architecture)處理器,這是 IBM 與 Arm 在 2026 年 4 月達成合作後的首個處理器成果。與過去分開配置 Arm 核心和 Z 核心的做法不同,每一顆處理器核心都能同時原生執行 Arm 與 IBM Z(或 LinuxONE)指令,讓企業得以在同一顆晶片上並行跑 Arm 原生的 Linux 環境與既有的 z/OS、Linux 工作負載。
依 Hot Chips 2026 上公開的技術細節,處理器採 2nm 製程、11 顆高效能核心,時脈超過 5.7GHz,支援 SMT=2,單核心配 36MB 私有 L2 快取,另有 432MB 虛擬 L3 與 3.5GB 虛擬 L4 快取。單一核心能原生執行兩種指令集,靠的是分支預測、暫存器重新命名與記憶體子系統等微架構元件在兩種 ISA 間共用,另外新增 SVE 控制邏輯與 FP16、Bfloat16 資料通路因應 Arm 向量運算,並沿用既有 Z 架構中記憶體複製、清除等 CISC 指令設計,整顆晶片共實作 2,792 條 AArch64 指令。晶片內建 AI 推論加速器用於交易中即時詐欺偵測,並有專屬的晶片上資料處理單元負責 I/O 加速,整體平台可擴展到數百核心與數十 TB 記憶體。
原始來源:Stripe Engineering Blog、Google Developers Blog、IBM Newsroom