前缀续写是指从指定前缀继续生成内容,Partial Mode 从给定的前缀继续生成内容,确保模型输出与前缀无缝衔接。详细参考阿里云百炼模型平台官网解读:https://www.aliyun.com/product/bailian
工作原理
使用 Partial Mode 时,需要配置 messages 数组:将数组最后一条消息的 role 设为 assistant,在 content 中填入前缀内容,并在该消息中设置 "partial": true 参数。messages 格式如下:
[ { "role": "user", "content": "Complete this Fibonacci function. Do not add anything else." }, { "role": "assistant", "content": "def calculate_fibonacci(n):\n if n <= 1:\n return n\n else:\n", "partial": true } ]
模型会从指定前缀开始继续生成文本。
支持的模型
- Qwen-Max 系列
- Qwen-Plus 系列(非思考模式)
- Qwen-Flash 系列(非思考模式)
- Qwen-Coder 系列
- Qwen-VL 系列 — qwen-vl-max 和 qwen-vl-plus 支持思考模式;qwen3-vl-plus 和 qwen3-vl-flash 仅支持非思考模式
- Qwen-Turbo 系列(非思考模式)
- Qwen 开源系列 — Qwen3.5 MoE/dense 模型支持思考模式;Qwen3.5-35B-A3B、Qwen3 和 Qwen3-VL 开源模型仅支持非思考模式
思考模式不支持前缀续写。对于支持非思考模式的模型,请使用非思考模式;或选择仅支持非思考模式的模型系列。详细参考阿里云通义大模型官网:https://www.aliyun.com/product/tongyi