VLM 与多模态应用

状态:🚧 占位待补齐
一句话定义:视觉语言模型(及更广多模态)如何进入业务:识图问答、单据理解、多模态 RAG。

大纲(待补齐)

  1. VLM 能力与局限
  2. 图文输入工程(分辨率、多图、PDF)
  3. 多模态检索与嵌入
  4. 安全:图中注入、隐私

已有相关文档(先读这些)

学习要点(补齐后应能回答)

  • 何时用 VLM 端到端,何时 OCR + 文本 LLM?
  • 多模态 RAG 的切分对象是什么?

参考资料(待补充)

-