Skip to content

图像识别 ​

  • 分类:生成

是什么 ​

把一张到八张本机静帧交给官方静帧反推,写出结构化识别结果(JSON Document v2)、摘要,以及可选的逐帧识别数组。本节点只关注识别结果;用途(配乐 / 音效 / 检索等)由下游节点在消费时自行处理。本节点不内嵌音效检索;需要搜音效时,把摘要或检索短句接到「查找音效」。

识别模式 ​

模式行为计费
综合(默认)多图一次 VL,一份综合描述1 次 invoke(多图抬高同一次 token,不是 ×n)
单张每图各自 caption(顺序请求;网关无批量多结果)N 次 invoke(N≤8)

上游取帧本机免费。

输入 ​

名称说明
图片输入本机静帧或时间轴截帧,最多 8 张

本节点没有帧元数据入桩。上游是「获取图片」时,执行会静默把对方的帧定位合并进 Document / 逐帧出桩的 sourceFrames,无需再接线。

输出 ​

名称说明
识别结果Document:schemaVersion: 2、result、sourceFrames(单张时帧可含 caption)、可选 queryForSearch
摘要综合:result.summary;单张:各帧 caption 换行拼接
逐帧识别与「获取图片」帧元数据同形的数组,可含每帧 caption;接到「创建时间线标记」的帧元数据即可按帧打点

设置项 ​

名称说明
识别模式综合 / 单张(分段条;写入 configValues.describeMode)

网关契约所需的 purpose 由客户端固定为 generic,用户不可选。

典型接线 ​

场景怎么接
取图→识别「获取图片」图片输出 → 本节点图片输入(定位静默进结果)
综合→打点本节点识别结果 → 「创建时间线标记」帧元数据(各点共用综合摘要)
单张→打点本节点逐帧识别 → 「创建时间线标记」帧元数据(一点一文案)
取图→仅定位打点「获取图片」帧元数据 → 「创建时间线标记」帧元数据(不必经识别)
只要文案摘要 → 「查找音效」/ 「文本生成」

典型下接 ​

文本生成、查找音效、创建时间线标记

使用注意 ​

  • 单次最多 8 张图;多出会截断。
  • 需要单独消费帧定位时,从「获取图片」的帧元数据出桩接线,或接本节点「逐帧识别」。
  • 失败时按登录 / 会员 / 瓶盖既有短句提示;单张模式任一帧失败则整单失败。
  • 结果卡仍为摘要展示;展开预览可见完整 Document(含 sourceFrames)。

智能体 / MCP ​

给智能体或开发者(可选)
  • 节点类型:still-describe
  • 入桩:仅 image-in;出桩:describe-io、summary、frames-describe-io
  • 设置:describeMode = combined | per_frame(默认 combined);执行层网关 purpose 固定 generic
  • Document:{ schemaVersion: 2, result, sourceFrames, queryForSearch? };帧可含 caption
  • frames-describe-io:BlueprintHostImageSourceFrame[](与 get-image frames-meta 同形)
  • 静默透传:image-in 上游 host-timeline-get-image → 合并 timeline
  • 计费:综合 1 invoke;单张 N invoke
  • 典型上游:host-timeline-get-image;下游:generate-text、audio-search、marker-create

鄂ICP备18026976号