Files
zk-data-agent/skills/label-master/knowledge/标签/通用问答/图片问答.md
T
2026-05-09 17:49:53 +08:00

4.5 KiB

图片问答

标注输出

注意:旧标签资料中同时存在 tag 标签和 Function 定义。本卡片不直接声明最终训练标签;生成数据前必须结合 判断维度/标注输出形态.md 确认当前任务使用 Agent 形式还是 Function 形式。

  • 旧 tag 标签:图片问答
  • Agent 包装候选(不代表最终):Agent(tag="图片问答")
  • Function 输出候选:VisionQA参数:imageSource:枚举类型direction:方位信息。大致为“前”、“后”、“左”、“右”、“左前”、“右前”、“左后”、“右后”、“附近”、“侧方”、“左上”、“右上”、“左下”、“右下”等object:业务加持信息。类别可枚举。Vehicle:车辆信息。包含三个可选参数:color (str): 车辆颜色brand (str): 车辆品牌,如小米、奔驰等type (str): 车辆类型,如救护车、军车等Text:阅读场景Food:食物场景Icon:图标/按钮场景Person:人物场景Animal:动物场景Plant:植物场景
  • 推荐输出形态:待确认。

功能抽象

图片通用问答

适用范围

使用VLM对图片内容进行理解并输出文字内容,所使用的信息源只有图片,没有其他方法调用或信息查询

典型 Query

描述一下这张图这是什么车这是什么动物拍照看看我前面有什么

三级语义功能点

待补充。

Function / Agent 说明

VisionQA参数:imageSource:枚举类型direction:方位信息。大致为“前”、“后”、“左”、“右”、“左前”、“右前”、“左后”、“右后”、“附近”、“侧方”、“左上”、“右上”、“左下”、“右下”等object:业务加持信息。类别可枚举。Vehicle:车辆信息。包含三个可选参数:color (str): 车辆颜色brand (str): 车辆品牌,如小米、奔驰等type (str): 车辆类型,如救护车、军车等Text:阅读场景Food:食物场景Icon:图标/按钮场景Person:人物场景Animal:动物场景Plant:植物场景

满足边界问题

【大原则】图片问答、拍照问答、屏幕问答、前车识别不做区分,未来都给VisionQA,图片来源通过imagesource来区分。备注:imagesource从qurey中提取,不会考虑设备类型。如果query中无法体现来源信息:屏幕、拍照、图片之一,则值为unknown,由下游skill满足侧决策。如果有精品垂域能满足,优先给能满足的精品垂域,否则给图片问答或者QA兜底。【和其他垂域的边界】地图问答和图片问答的边界:【方位指示代词】+【建筑、楼、poi】给地图问答,地图问答的实际满足能力分端,但是语义code层面不用分端,具体如下:车载、眼镜:地图问答有多模态能力,结合location、图片进行满足。对应意图标签:拍照问答。手机:地图问答没有多模态能力,结合location进行普通文本问答。QA和图片问答的边界:主要是模糊类query,不同端不一致,比如:q=比如我前边是什么东西?手机端:应该给QA兜底。因为【东西】非建筑等宏观物体,因此不给地图问答;手机没有view视野,因此没有前边的概念,不能给拍照问答。眼镜端:拍照问答,有实时视野画面,需要进行视觉理解。车载端:QA,歧义query,图片问答、地图问答都不接。记忆和图片问答的边界,记忆有多模态能力,优先给记忆精品垂域。举例:记一下这个卡路里。打电话和图片问答的边界,打电话有多模态能力,如果这个是指屏幕上的电话,优先给电话。举例:打给这个电话和文档总结的边界,文档总结有多模态能力,文档总结的多模态问答优先给文档总结和其他Agent,由于如下Agent没有多模态能力,因此按照原则由图片问答兜底,由于理解用户query需要视觉能力,因此图片问答优先级高于QA,包括如下,内容agent,举例:屏幕上这歌原唱是谁、播放这部电影WeatherQA,举例:照片中城市最近的天气lifeAgent,举例:图中景点门票多少钱、图中手机多少钱、帮我买屏幕上这款汽车controlAgent:安装这个app

易混淆标签

地图问答

划分原则

图片问答所使用的信息源只有图片,没有其他方法调用或信息查询,如果使用了其他方法或信息源,给到其他具体垂域(待讨论)图片问答和翻译、文档总结、走哪问哪等边界问题

未解决问题

待补充。