身份感知视频理解框架与基准发布
热点事件历史事件
身份感知视频理解框架与基准发布
1 篇报道1 个报道来源4 天前更新
先了解这件事
AI 综述
Anas Filali Razzouki 提出一套身份感知视频字幕与人物中心问答框架,把自动角色识别、显式空间定位和任务适配结合起来。该框架以 LSMDC v2 电影片段为起点,将检测到的人脸与演员参考图像匹配、跨帧追踪角色,并构建带身份关联边界框的输入。 基于此,作者构建了包含 750 个字幕片段和 3,000 个人物中心问题的基准,并在 GitHub 发布基准、训练数据、代码和 BAC 检查点。这些发布内容与效果均出自论文自述。
AI 根据报道生成 · 3 天前更新
最新进展10月7日 22:41
超越匿名字幕:视频字幕与问答中的角色身份锚定报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv 隐私论文超越匿名字幕:视频字幕与问答中的角色身份锚定
研究提出身份感知视频字幕与人物中心问答框架,基于 LSMDC v2 电影片段将检测人脸匹配演员参考图像并跨帧追踪角色,构建含 750 个字幕片段和 3,000 个人物中心问题的基准。