跳到正文
热点事件历史事件

身份感知视频理解框架与基准发布

1 篇报道1 个报道来源4 天前更新

先了解这件事

AI 综述

Anas Filali Razzouki 提出一套身份感知视频字幕与人物中心问答框架,把自动角色识别、显式空间定位和任务适配结合起来。该框架以 LSMDC v2 电影片段为起点,将检测到的人脸与演员参考图像匹配、跨帧追踪角色,并构建带身份关联边界框的输入。 基于此,作者构建了包含 750 个字幕片段和 3,000 个人物中心问题的基准,并在 GitHub 发布基准、训练数据、代码和 BAC 检查点。这些发布内容与效果均出自论文自述。

AI 根据报道生成 · 3 天前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv 隐私论文
    超越匿名字幕:视频字幕与问答中的角色身份锚定

    研究提出身份感知视频字幕与人物中心问答框架,基于 LSMDC v2 电影片段将检测人脸匹配演员参考图像并跨帧追踪角色,构建含 750 个字幕片段和 3,000 个人物中心问题的基准。