性能
Link Astra 專為高吞吐量和低延迟而設計。本页提供性能基準和優化建議。
延迟基準
以下典型響應時間在希尔斯伯勒和新加坡區域測得:
| 模型 | 首 token 時間(TTFT) | 每秒輸出 token 數 |
|---|---|---|
| deepseek/deepseek-v4-flash | ~200ms | ~80 tok/s |
| deepseek/deepseek-v4-pro | ~500ms | ~40 tok/s |
| z-ai/glm-5.1 | ~400ms | ~50 tok/s |
| z-ai/glm-5.2 | ~600ms | ~35 tok/s |
| linkwo/fusion | ~300ms | ~60 tok/s |
| astra | ~400ms | ~45 tok/s |
以上數值為近似值,會因輸入長度、輸出長度和当前負載而变化。測量使用短提示词(約 100 token 輸入)。
區域延迟
| 客戶端位置 → API 區域 | 預估延迟 |
|---|---|
| 新加坡 → api.linkastra.ai | ~15ms |
| 東京 → api.linkastra.ai | ~50ms |
| 美國西部 → api.linkastra.ai | ~15ms |
| 美國東部 → api.linkastra.ai | ~60ms |
| 欧洲 → api.linkastra.ai | ~200ms |
| 南美洲 → api.linkastra.ai | ~120ms |
吞吐量
| 等級 | 最大並發請求數 | 預估最大 TPM |
|---|---|---|
| Free | 2 | 40,000 |
| Standard | 10 | 200,000 |
| Pro | 30 | 1,000,000 |
| Enterprise | 自定義 | 自定義 |
優化建議
降低延迟
- 選擇合適的區域 — 使用
api.linkastra.ai自動路由到最近區域 - 使用 Flash 模型 — DeepSeek V4 Flash 比 Pro 快 2-3 倍
- 啓用流式響應 — 在 token 生成時即時接收,無需等待完整響應
- 精简提示词 — 輸入 token 越少,處理越快
最大化吞吐量
- 批量請求 — 對非實時工作負載使用 Batch API
- 連接池 — 跨請求復用 HTTP 連接
- 並發請求 — 在速率限制范围內並行發送多個請求
- 缓存結果 — 避免對相同輸入重復調用 API
减少 token 用量
- 設定
max_tokens— 不需要長響應時限制輸出長度 - 使用简洁的提示词 — 表達具體,避免多余上下文
- 善用系統提示词 — 一次性設定行為,無需在每条消息中重復
- 使用結構化輸出 — 直接請求 JSON,避免冗長的格式化
監控用量
聯繫 support@linkastra.ai 获取你帳戶的性能指标:
- 請求延迟分位數(p50、p90、p99)
- token 用量随時間变化
- 各模型錯誤率
- 速率限制利用率