Skip to content

Navigation Menu

Sign in
Sign up

[Question]: Dualvln数据配比 #363

Open

Description

Question

• 作者您好,感谢开源 InternNav 和 DualVLN。

我们按照公开配置完成了两阶段训练:

  • Stage 1:R2R 4组视角 + RxR 4组视角 + ScaleVLN 2组视角,均按100%使用;
  • Stage 2:R2R、RxR、ScaleVLN各2组视角,每组使用%30采样;
  • 单节点8张80GB GPU;
  • per-device batch size为2,gradient accumulation steps为8,global batch size为128;
  • Stage 1训练14k steps,Stage 2训练15k steps。

最终在R2R val_unseen上得到SR 57.69、SPL 53.71,与官方SR 64.3、SPL 58.5仍有差距。

想请问官方结果实际使用的训练配置:

  1. 官方训练是否还混入EnvDrop或general video QA?如果有,大致数据比例是多少?
  2. 官方最终结果对应的Stage 1和Stage 2分别训练了多少optimizer steps?
  3. Stage 1的停止条件是论文中的14k steps、Issue中建议的约20k steps,还是按完整epoch训练?
  4. 官方实际使用的GPU数量、单卡batch size和global batch size是多少?

感谢!

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions

      AltStyle によって変換されたページ (->オリジナル) /