图像识别
- 分类:生成
是什么
把一张到八张本机静帧交给官方静帧反推,写出结构化识别结果(JSON Document v2)、摘要,以及可选的逐帧识别数组。本节点只关注识别结果;用途(配乐 / 音效 / 检索等)由下游节点在消费时自行处理。本节点不内嵌音效检索;需要搜音效时,把摘要或检索短句接到「查找音效」。
识别模式
| 模式 | 行为 | 计费 |
|---|---|---|
| 综合(默认) | 多图一次 VL,一份综合描述 | 1 次 invoke(多图抬高同一次 token,不是 ×n) |
| 单张 | 每图各自 caption(顺序请求;网关无批量多结果) | N 次 invoke(N≤8) |
上游取帧本机免费。
输入
| 名称 | 说明 |
|---|---|
| 图片输入 | 本机静帧或时间轴截帧,最多 8 张 |
本节点没有帧元数据入桩。上游是「获取图片」时,执行会静默把对方的帧定位合并进 Document / 逐帧出桩的 sourceFrames,无需再接线。
输出
| 名称 | 说明 |
|---|---|
| 识别结果 | Document:schemaVersion: 2、result、sourceFrames(单张时帧可含 caption)、可选 queryForSearch |
| 摘要 | 综合:result.summary;单张:各帧 caption 换行拼接 |
| 逐帧识别 | 与「获取图片」帧元数据同形的数组,可含每帧 caption;接到「创建时间线标记」的帧元数据即可按帧打点 |
设置项
| 名称 | 说明 |
|---|---|
| 识别模式 | 综合 / 单张(分段条;写入 configValues.describeMode) |
网关契约所需的 purpose 由客户端固定为 generic,用户不可选。
典型接线
| 场景 | 怎么接 |
|---|---|
| 取图→识别 | 「获取图片」图片输出 → 本节点图片输入(定位静默进结果) |
| 综合→打点 | 本节点识别结果 → 「创建时间线标记」帧元数据(各点共用综合摘要) |
| 单张→打点 | 本节点逐帧识别 → 「创建时间线标记」帧元数据(一点一文案) |
| 取图→仅定位打点 | 「获取图片」帧元数据 → 「创建时间线标记」帧元数据(不必经识别) |
| 只要文案 | 摘要 → 「查找音效」/ 「文本生成」 |
典型下接
使用注意
- 单次最多 8 张图;多出会截断。
- 需要单独消费帧定位时,从「获取图片」的帧元数据出桩接线,或接本节点「逐帧识别」。
- 失败时按登录 / 会员 / 瓶盖既有短句提示;单张模式任一帧失败则整单失败。
- 结果卡仍为摘要展示;展开预览可见完整 Document(含
sourceFrames)。
智能体 / MCP
给智能体或开发者(可选)
- 节点类型:
still-describe - 入桩:仅
image-in;出桩:describe-io、summary、frames-describe-io - 设置:
describeMode=combined|per_frame(默认 combined);执行层网关purpose固定generic - Document:
{ schemaVersion: 2, result, sourceFrames, queryForSearch? };帧可含caption frames-describe-io:BlueprintHostImageSourceFrame[](与 get-imageframes-meta同形)- 静默透传:image-in 上游
host-timeline-get-image→ 合并 timeline - 计费:综合 1 invoke;单张 N invoke
- 典型上游:
host-timeline-get-image;下游:generate-text、audio-search、marker-create