The Vision Intelligence lab at Samsung's Mountain View research center seeks interns to conduct long-term research with potential for direct impact on future Samsung products. The team focuses on advancing multimodal understanding and generation technologies.
Core Responsibilities
- Research multi-modal models in retrieval, question answering, reasoning, generation, and editing.
- Develop maintainable code implementing research concepts.
- Collaborate with team members discussing findings and refining methodologies.
- Execute experiments while documenting progress and presenting insights.
- Prepare findings for major conference or journal submissions.
Required Qualifications
- Currently enrolled in MS or PhD program.
- Proficiency in Python, PyTorch, and Transformers frameworks.
- Prior publications in top-tier venues (CVPR, ECCV, ICCV, ICML, NeurIPS, AAAI).
- Expertise in VLMs, diffusion models, efficient multi-modal design, or Vision Language Action Models.
- Strong communication abilities.