
公司真题库2026-07-27
【字节跳动】多模态大模型了解多少?视觉-语言模型的主流架构有哪几种?
字节实习二面真题:考察对 VLM 架构谱系的梳理——双塔对比式(CLIP)、LLM 外挂视觉编码器(LLaVA/BLIP-2)、原生早融合三类路线,差异在融合深度与图文 token 的处理方式。
91学AI·10 阅读
共 3 篇文章

字节实习二面真题:考察对 VLM 架构谱系的梳理——双塔对比式(CLIP)、LLM 外挂视觉编码器(LLaVA/BLIP-2)、原生早融合三类路线,差异在融合深度与图文 token 的处理方式。

阿里 Agent 开发校招一面真题:考察多模态文档 RAG——图片的 OCR/VLM 描述/向量化三条处理路线,chunk 与图片的关联索引,以及如何用引用和图片回填避免信息丢失。

考察异构文档解析的工程能力:文字版与扫描版 PDF 的分流、表格结构抽取、OCR 与版面分析方案,以及多模态内容入库策略。