Moyan AI Training Institution LogoMoyan AI

Alignment & Preference Tuning · Fast-moving · Advanced

Direct Alignment from Preference Pools

Also known as: ORPO, KTO

Post-training methods that integrate preference alignment directly into supervised fine-tuning loss functions without pair data.

What Direct Alignment from Preference Pools is

Eliminates separate preference dataset formatting, reducing post-training pipeline complexity.

How it works

Applies odds-ratio penalties to disfavored tokens during standard cross-entropy training.

Why it matters

Allows efficient single-stage fine-tuning for specialized domain models.

Common uses

  • Domain model fine-tuning
  • Streamlined alignment pipelines
  • Resource-efficient model specialization

More in this collection

Browse all AI Concepts