OpenRLHF-M开源项目 – 高性能的RLHF框架

一个简单易用、可扩展且高性能的强化学习人类反馈（RLHF）框架。它能解决大语言模型对齐和优化的问题，让模型更好地理解和生成人类期望的内容。

OpenRLHF-M的特点:

1. 支持70B+参数模型的完整微调，性能提升3-4倍
2. 集成LoRA、RingAttention等技术，优化训练效率
3. 兼容Hugging Face模型和数据集，无缝对接现有生态

OpenRLHF-M的功能:

1. 用于大语言模型的对齐和优化
2. 进行强化学习的人类反馈训练
3. 提升模型的性能和训练效率

相关导航

Qwen2.5-Max开源项目 – 高性能大型预训练模型

Qwen2.5-Max是一个基于大量数据进行预训练的大型MOELLM，通过策划的SFT和RLHF配方进行后训练，实现了与顶级型号竞争的性能。该模型在多个基准测试中表现出色，包括Arena Hard、LiveBench、LiveCodeBench和GPQA-Diamond等，甚至击败了DeepSeek V3，并在理论性能上超越了DeepSeek-V3。

ChatGLM-LoRA-RLHF-PyTorch开源项目 – 基于LoRA和RLHF的ChatGLM微调

该项目提供了一个完整的管道，用于在消费级硬件上微调ChatGLM LLM，结合了LoRA（低秩适应）和RLHF（基于人类反馈的强化学习）技术，旨在提升ChatGLM的能力，使其类似于ChatGPT。

Reward Feature Models (RFM)论文 – 个性化偏好建模方法

Reward Feature Models (RFM) 是一种在强化学习从人类反馈 (RLHF) 中捕捉个体偏好的方法，特别适用于大型语言模型 (LLMs) 的训练。它通过学习跨用户共享的通用奖励特征和用户特定的权重来实现个性化。训练过程分为两个阶段：训练阶段学习共享特征和初始用户权重，适应阶段使用有限反馈快速调整新用户权重。研究表明，RFM 在用户内泛化性能上与 Variational Preference Learning (VPL) 相当，同时在用户间泛化能力上表现更优。

RAGEN开源 – 首个开源DeepSeek-R1强化学习框架

RAGEN 是 DeepSeek-R1 强化学习训练框架的首个开源复制品，专注于训练大型语言模型（LLM）推理代理。它支持多轮统一处理，避免批量大小不稳定，提供世界建模能力，并帮助智能体进行规划。特别适用于交互式和随机环境中的多步任务训练，如 Sokoban 谜题和 FrozenLake 环境。

ManiSkill开源项目 – 机器人操作技能模拟与训练框架

ManiSkill 是一个由 SAPIEN 提供支持的强大统一框架，专注于机器人操作技能的模拟与训练。它支持 GPU 并行化、异构模拟、光线追踪渲染和物理接触模拟，并提供灵活的任务构建 API。ManiSkill 3 目前处于 Beta 版本，支持强化学习、模仿学习和大规模视觉语言动作 (VLA) 模型，适用于多种机器人体现和任务，如桌面操作、绘图、清洁和灵巧操作。

R1-Searcher开源 – 提升LLM搜索能力的强化学习框架

R1-Searcher 是一个两阶段强化学习框架，旨在提升大型语言模型（LLM）的搜索能力。该框架通过结果导向的奖励机制工作，无需依赖过程奖励或知识蒸馏。研究表明，它允许 LLM 在推理过程中自主调用外部搜索系统，整合外部知识来解决知识密集型查询。在某些基准测试中，R1-Searcher 的表现显著优于现有的检索增强生成（RAG）方法，甚至与闭源模型（如 GPT-4o-mini）相当或更优。

LLM-Dojo开源项目 – 开源大模型学习场，适合AI爱好者

LLM-Dojo是一个开源大模型学习场，提供简洁易读的代码框架，支持多种主流模型的训练和强化学习技术，旨在帮助AI爱好者和研究者进行深入的研究和开发。

tiny-grpo开源 – 简易GRPO实现

tiny-grpo是一个强化学习项目，专注于GRPO（引导强化策略优化）算法的实现。它的设计目标是简单易用，适合那些希望快速开始强化学习项目的用户。项目提供了完整的训练脚本和依赖配置，支持单机多GPU训练，特别适合初学者和教育场景。

multi_timescale_replay开源项目 – 多时间尺度回放的持续强化学习

multi_timescale_replay 是一个专注于多时间尺度回放机制的强化学习项目，旨在提高动态环境中的学习效率和适应性。该项目通过实现多时间尺度回放机制，支持在动态环境中的持续强化学习，并提供工具来实验不同的回放策略。此外，项目还包含基准测试和评估指标，用于评估性能。

LongSpec开源项目 – 高效解码长文本场景

长文本场景下的高效解码方案，让大语言模型推理不再卡顿。

Reward-aware Preference Optimization官网 – 统一多种偏好优化算法的框架

RPO框架是由NVIDIA提出的一个统一数学框架，旨在整合多种偏好优化算法（如DPO、IPO等），通过实验分析模型对齐的关键因素，为提升大型语言模型（LLM）的对齐效果提供理论和实践指导。该框架特别关注如何利用奖励机制优化模型偏好，确保模型输出更符合人类期望，并已被整合到NVIDIA NeMo框架中。