← 返回名录条目信息来自其公开主页与公开发布内容。按本站规范,页面不展示任何联系方式。 需要更正或删除?通过收录与更正通道提交,24 小时内处理。
Z
Zhongyang Hu
NLP researcher & AI developer, with a focus on PEFT & RL
- 公司
- Xi'an Jiaotong-Liverpool University
- 位置
- Suzhou
- Stars
- 206
- 粉丝 / 仓库
- 30
代表作品 / 项目
- Chinese-MedQA-Qwen2⭐ 90基于Qwen2+SFT+DPO的医疗问答系统,项目中使用了自定义的 SFTTrainer/DPOTrainer/TRPOTrainer用于训练,其次,项目还调用各种知识库工具(neo4j, milvus, LDA, 等)进行自动化训练数据生成。另外,使用 vllm 用于推理和部署训好的模型, 该模型会通过 vllm API 来接入一个基于 embedder + Reranker 的 RAG 系统。另外还参考 MDAgents 论文实现了一个多智能体会诊系统,同样也支持 vllm api 接入。
- Travel-Agent-based-on-Qwen2-RLHF⭐ 83A travel agent based on Qwen2.5, fine-tuned by SFT + DPO/PPO/GRPO using traveling question-answer dataset, a mindmap can be output using the response. A RAG system is build upon the tuned qwen2, using Prompt-Template + Tool-Use + Chroma embedding database + LangChain
- bert-gpt2-ecommerce-review-ner⭐ 7基于Bert+MoE+Qwen2拼接后的模型和LoRA微调的电商评论NER模型。使用transformers+deepspeed进行训练,swanlab进行监控。
- InstructGPT-reproduce⭐ 4reproduce the Instruct from the paper 《Training language models to follow instructions with human feedback》
- prm-reproduce⭐ 3Reproduce the Process Reward Model (PRM) from OpenAI's paper 《Let's verify step by step》