Search stories

All stories

Vals Launches With Aim to Set New Standard for AI BenchmarkingOpenAI Releases Framework for Reporting Model MisalignmentVantora (formerly UP.Labs) Raises $100M to Build Startups Focused on Physical AI for IndustryOpenAI Announces Astra for Law for Firm WorkflowsAnthropic Runs Lab for Biology ExperimentsVerbose Prompts Help Vision-Language Models Resist Image CorruptionOpenAI Research Studies How Workers Integrate AI Beyond Traditional RolesResearchers Stress-Test Alignment Midtraining Across 110-Billion-Parameter AI ModelsGoogle DeepMind Launches Institute to Widen Debate on AGIAI Evaluator Forum Releases AEF-1 Standard for Third-Party AI EvaluationsGood Start Labs Trains AI on Railroad Strategy Game to Boost Finance Benchmark ScoresAIUC Raises $40M Series A and Launches Insured Agent Standard AIUC-1
All stories

Researchers Stress-Test Alignment Midtraining Across 110-Billion-Parameter AI Models

In a paper published on ArXiv CS.AI, researchers evaluated alignment midtraining up to 110-billion-parameter models and found that its steering effects are fragile against competing finetuning data.

Fragile Steering and Rule Learning

The authors found that alignment midtraining can steer model motivations in simple scenarios, but a tiny fraction of competing finetuning data eliminates those gains. Additionally, models required direct demonstrations in either midtraining or post-training datasets to learn rules robustly. [1]

Sources

  1. 01
    ArXiv CS.AI · Primary source
    Stress-testing Alignment Midtraining