性能

Link Astra 專為高吞吐量和低延迟而設計。本页提供性能基準和優化建議。

延迟基準

以下典型響應時間在希尔斯伯勒和新加坡區域測得:

模型首 token 時間(TTFT)每秒輸出 token 數
deepseek/deepseek-v4-flash~200ms~80 tok/s
deepseek/deepseek-v4-pro~500ms~40 tok/s
z-ai/glm-5.1~400ms~50 tok/s
z-ai/glm-5.2~600ms~35 tok/s
linkwo/fusion~300ms~60 tok/s
astra~400ms~45 tok/s

以上數值為近似值,會因輸入長度、輸出長度和当前負載而变化。測量使用短提示词(約 100 token 輸入)。

區域延迟

客戶端位置 → API 區域預估延迟
新加坡 → api.linkastra.ai~15ms
東京 → api.linkastra.ai~50ms
美國西部 → api.linkastra.ai~15ms
美國東部 → api.linkastra.ai~60ms
欧洲 → api.linkastra.ai~200ms
南美洲 → api.linkastra.ai~120ms

吞吐量

等級最大並發請求數預估最大 TPM
Free240,000
Standard10200,000
Pro301,000,000
Enterprise自定義自定義

優化建議

降低延迟

  • 選擇合適的區域 — 使用 api.linkastra.ai 自動路由到最近區域
  • 使用 Flash 模型 — DeepSeek V4 Flash 比 Pro 快 2-3 倍
  • 啓用流式響應 — 在 token 生成時即時接收,無需等待完整響應
  • 精简提示词 — 輸入 token 越少,處理越快

最大化吞吐量

  • 批量請求 — 對非實時工作負載使用 Batch API
  • 連接池 — 跨請求復用 HTTP 連接
  • 並發請求 — 在速率限制范围內並行發送多個請求
  • 缓存結果 — 避免對相同輸入重復調用 API

减少 token 用量

  • 設定 max_tokens — 不需要長響應時限制輸出長度
  • 使用简洁的提示词 — 表達具體,避免多余上下文
  • 善用系統提示词 — 一次性設定行為,無需在每条消息中重復
  • 使用結構化輸出 — 直接請求 JSON,避免冗長的格式化

監控用量

聯繫 support@linkastra.ai 获取你帳戶的性能指标:

  • 請求延迟分位數(p50、p90、p99)
  • token 用量随時間变化
  • 各模型錯誤率
  • 速率限制利用率

相關文件