Skip to main content

概述

ZAI 的 GLM 聊天模型运行在 VibeToken 上,通过标准的兼容 OpenAI 的聊天补全端点提供服务,支持流式输出和工具调用。涵盖 GLM-4.5GLM-4.6GLM-4.7GLM-5 系列,包括具备视觉能力的 GLM-4.5V / GLM-4.6V

模型与定价

按每 100 万 tokens 计价,依据实际用量计费(无需预付)。Cache Read 为提示词缓存命中的折后费率(在 ZAI 公布该费率时适用,且不单独收取缓存写入费); 表示缓存部分按完整的 Input 费率计费。 实时费率和完整的聊天模型目录始终可通过 Models API 获取。

端点

与 OpenAI 的 Chat Completions API 无缝兼容 —— 将你现有的 OpenAI 客户端指向 https://vibetoken.cn/v1,并使用 你的 VibeToken 密钥即可。有关所有支持的参数,请参阅完整的 Chat Completions 参考文档

快速开始

设置 "stream": true 即可启用 token 流式输出(Server-Sent Events), 与 OpenAI API 完全一致。将 model 替换为上表中的任意 id 即可。

视觉输入(GLM-4.5V / GLM-4.6V)

*V 模型使用标准的 OpenAI content-parts 格式,可在文本之外同时接受图像: