VLM 与多模态应用
状态:🚧 占位待补齐
一句话定义:视觉语言模型(及更广多模态)如何进入业务:识图问答、单据理解、多模态 RAG。
大纲(待补齐)
- VLM 能力与局限
- 图文输入工程(分辨率、多图、PDF)
- 多模态检索与嵌入
- 安全:图中注入、隐私
已有相关文档(先读这些)
学习要点(补齐后应能回答)
- 何时用 VLM 端到端,何时 OCR + 文本 LLM?
- 多模态 RAG 的切分对象是什么?
参考资料(待补充)
-
状态:🚧 占位待补齐
一句话定义:视觉语言模型(及更广多模态)如何进入业务:识图问答、单据理解、多模态 RAG。
-
评论
评论加载中…