
Grpo Rlvr Training
作者 wshobson46891e7e60da无许可证收录于 2026年10月8日更新于 2026年10月8日
Train reasoning and verifiable-task behavior with GRPO and reinforcement learning from verifiable rewards (RLVR). Use when task success is algorithmically checkable (math, code, tool calls, structured output), when designing GRPO reward functions, or when a GRPO run diverges or reward-hacks.
- 46891e7e60da当前提交 46891e7发布于 2026年10月8日
来源与署名
来源:wshobson/agents位于plugins/llm-finetuning/skills/grpo-rlvr-training提交46891e7
许可证: 无许可证
内容归原作者所有。SourceWeft 从公开仓库中收录这些内容。
更多来自 wshobson/agents 的技能

Uv Package Manager
wshobson
关于使用 uv Python 包管理器管理依赖、虚拟环境和项目工作流的参考指南。

Web Component Design
wshobson
指导在 React、Vue 和 Svelte 中构建可复用 UI 组件,涵盖组合模式、CSS-in-JS 选择与组件 API 设计。

Python Type Safety
wshobson
指导 Python 类型注解、泛型、协议以及 mypy/pyright 严格类型检查。

Visual Design Foundations
wshobson
指导排版、色彩、间距与图标设计,帮助建立统一且无障碍的视觉设计体系。

Responsive Design
wshobson
指导使用容器查询、流体排版、CSS Grid 和断点策略实现响应式网页布局。

Python Resource Management
wshobson
指导 Python 开发者使用上下文管理器、清理模式和流式处理来确定性管理资源。
更多AI & Agents技能

Skill Development
anthropics
指导创建 Claude Code 插件技能,涵盖结构、描述、渐进式披露与验证。

Plugin Structure
anthropics
指导 Claude Code 插件的结构、清单与组件布局。

Command Development
anthropics
指导创建 Claude Code 斜杠命令,涵盖结构、YAML frontmatter、参数与插件功能。

Claude Md Improver
anthropics
审查仓库中的 CLAUDE.md 文件,评估其质量,并在获得批准后应用有针对性的改进。

Smb Onboard
anthropics
引导小微企业主完成首次设置:连接工具、运行一次体现价值的配方、记录业务背景并设定每周检查节奏。

Smb Router
anthropics
将小企业主的需求转接到合适的插件技能或命令,并说明可用功能。