Current Vacancies

Current Vacancies

Intern -Surgical Video Understanding & Multimodal Large Language Models



实习生 - 手术视频理解与多模态大模型


岗位职责

1.模型研发支持:协助团队开展手术视频理解基础大模型开发,包括使用标注工具对手术视频中的关键动作、器械使用等行为进行标注;基于标注数据,参与手术行为分析 模块、手术阶段识别模块的算法调优与模型训练,记录训练过程中的关键参数与实验结果 。 
2.数据处理与构建:前往合作医院等真实临床场景,按照既定标准收集手术视频数据, 对数据进行格式转换、去噪等预处理;参与构建手术视频数据集,整理手术视频的元数据信息(如手术类型、主刀医生、手术时长等);协助构建视觉 - 语言预训练数据 集,完成视频片段与对应文本描述的匹配、校对工作。 
3.技术探索与实验:调研多模态预训练技术前沿论文,撰写技术调研报告;在团队指导 下,使用现有开源多模态预训练模型,结合手术视频数据进行小规模实验;通过调整 超参数、修改网络结构等方式,探索提升模型对手术环境上下文知识学习效果的方法。 
4.临床应用辅助:在临床场景中,协助医生使用已开发的手术视频分析模型,收集医生 在使用过程中的反馈意见;整理模型分析结果,生成可视化报告,为临床决策提供直 观的数据参考。 
5.成果整理输出:按照学术规范,整理实验过程中的数据、图表,撰写技术文档;协助团队进行专利申请材料的准备,挖掘研究成果中的创新点;参与学术论文的撰写工作,负责部分章节的初稿撰写与文献资料收集。


任职要求

1.计算机视觉、自然语言处理或相关领域学习背景,具备跨学科知识基础。
2.有使用多模态大型模型(如 LLaVA、BLIP、Qwen-VL)进行开发的经验,了解模型预训练、微调流程;熟悉预训练算法,如 MAE、Dino、自监督学习、视觉 - 语言对齐等,能理解算法原理及在模型训练中的作用。 
3.掌握 Python 编程语言,能使用 PyTorch、TensorFlow 等深度学习框架完成简单的 模型搭建与训练任务;熟悉 RAG 或 Agent 开发技术(如 RAG、LangChain、LlamaIndex),有相关项目实践经历。 
4.有视频处理、分析的项目经验,熟悉视频数据的常用处理方法。
5.了解上下文学习、提示工程与提示微调技术,有相关实践经验。 
6.有学术论文撰写或参与科研项目经历者优先,具备一定的科研能力。


申请方式

请将个人简历发送至 hr02@cair-cas.org.hk,邮件主题请注明:应聘岗位-姓名-官网投递。