Iseer Logo
Capabilities#2843concluded

In-Context Learning: Compositional Generalization

Models demonstrate surprising ability to compose novel skills from few-shot examples, but performance degrades predictably based on conceptual distance between training examples and test cases.

September 15, 2025
Dr. Rebecca Chen, K. Patel
In-Context Learning: Compositional Generalization

Abstract

Our investigation into in-context learning reveals that models can compose novel skills from few-shot examples, but this ability follows predictable patterns based on the conceptual distance between training examples and test cases. This field note documents our systematic study of compositional generalization in large language models.

Experimental Design

Task Composition Framework

We developed a systematic framework for testing compositional generalization:

  1. Base Skills: Individual capabilities (e.g., arithmetic, translation, logical reasoning)
  2. Composition Rules: How skills can be combined (e.g., sequential, parallel, conditional)
  3. Novel Combinations: Test cases requiring composition of skills not seen together during training

Distance Metrics

We developed several metrics to quantify conceptual distance:

  • Semantic Distance: Based on embedding similarity of task descriptions
  • Structural Distance: Based on the complexity of composition required
  • Domain Distance: Based on the similarity of knowledge domains involved

Key Findings

Compositional Capability

Models show remarkable ability to compose skills:

  • Novel Combinations: 78% success rate on completely novel skill combinations
  • Complex Compositions: 65% success rate on 3+ skill compositions
  • Cross-Domain Composition: 71% success rate on skills from different domains

Distance-Performance Relationship

Performance degrades predictably with conceptual distance:

| Distance Type | Low Distance | Medium Distance | High Distance | |---------------|--------------|-----------------|---------------| | Semantic | 89% | 76% | 58% | | Structural | 85% | 72% | 61% | | Domain | 82% | 69% | 55% |

Composition Patterns

We identified several successful composition patterns:

  1. Sequential Composition: Skills applied in sequence (e.g., translate then summarize)
  2. Parallel Composition: Skills applied simultaneously (e.g., analyze sentiment and extract entities)
  3. Conditional Composition: Skills applied based on conditions (e.g., if text is long, then summarize)
  4. Iterative Composition: Skills applied repeatedly with refinement

Failure Mode Analysis

Common Failure Patterns

Our analysis reveals several consistent failure modes:

  1. Skill Interference: One skill interfering with another's execution
  2. Context Confusion: Model losing track of which skill to apply when
  3. Composition Complexity: Performance degrading with increasing composition complexity
  4. Domain Mismatch: Poor performance when combining skills from very different domains

Error Categories

We categorized errors into several types:

  • Execution Errors: Correct composition strategy but poor execution (23%)
  • Strategy Errors: Wrong composition approach (31%)
  • Context Errors: Losing track of task requirements (28%)
  • Skill Errors: Individual skill failures (18%)

Theoretical Implications

Compositional Generalization

Our findings support theories of compositional generalization:

  • Systematic Generalization: Models can generalize to novel combinations systematically
  • Distance-Based Degradation: Performance follows predictable distance-based patterns
  • Emergent Composition: Compositional ability emerges from training on diverse tasks

Few-Shot Learning Mechanisms

The results suggest several mechanisms for few-shot learning:

  1. Pattern Matching: Models match new tasks to similar training examples
  2. Skill Decomposition: Models break down complex tasks into component skills
  3. Composition Learning: Models learn general principles of skill composition
  4. Meta-Learning: Models develop meta-strategies for learning new skills

Practical Applications

Prompt Engineering

Our findings inform prompt engineering strategies:

  • Distance-Aware Prompting: Adjusting prompts based on conceptual distance
  • Composition Guidance: Explicitly guiding model composition strategies
  • Skill Priming: Priming models with relevant skills before composition

Model Training

The results suggest training improvements:

  • Compositional Training: Explicitly training for compositional generalization
  • Distance-Aware Sampling: Sampling training examples based on conceptual distance
  • Skill Decomposition: Training models to explicitly decompose complex tasks

Scaling Analysis

Model Size Effects

We analyzed how compositional ability scales with model size:

  • Small Models (1B-7B): Limited compositional ability, high failure rates
  • Medium Models (13B-70B): Significant improvement in composition success
  • Large Models (175B+): Near-human levels of compositional generalization

Data Requirements

Our analysis suggests data requirements for compositional learning:

  • Skill Diversity: Models need exposure to diverse individual skills
  • Composition Examples: Explicit examples of skill composition help
  • Distance Coverage: Training data should cover various conceptual distances

Comparison with Human Learning

Similarities

Models show several similarities to human compositional learning:

  • Distance-Based Performance: Both show distance-based degradation
  • Composition Strategies: Similar strategies for combining skills
  • Error Patterns: Comparable error types and frequencies

Differences

Key differences from human learning:

  • Speed: Models can compose skills much faster than humans
  • Consistency: Models show more consistent performance across trials
  • Domain Transfer: Models may be better at cross-domain composition

Future Research Directions

Immediate Studies

  1. Composition Training: Developing training methods to improve compositional ability
  2. Distance Metrics: Refining our distance measurement approaches
  3. Error Analysis: Deeper analysis of composition failure modes

Long-term Research

  1. Compositional Architectures: Designing architectures optimized for composition
  2. Meta-Learning: Developing models that learn to learn compositions
  3. Human-AI Collaboration: Studying how humans and AI can collaborate on composition

Implications for AI Development

Capability Assessment

These findings help assess AI capabilities:

  • Compositional Benchmarks: New benchmarks for testing compositional generalization
  • Capability Limits: Understanding the boundaries of compositional ability
  • Improvement Strategies: Clear directions for improving compositional performance

Safety Considerations

Compositional ability has safety implications:

  • Unintended Compositions: Models might compose skills in unexpected ways
  • Capability Emergence: New capabilities might emerge from skill composition
  • Control Challenges: Composed behaviors might be harder to predict and control

Conclusion

Our study of compositional generalization in in-context learning reveals both the remarkable capabilities and predictable limitations of large language models. The distance-based performance patterns we observe provide a framework for understanding and improving compositional ability.

These findings have important implications for both theoretical understanding of AI capabilities and practical applications of few-shot learning. The systematic nature of compositional generalization suggests that this ability can be studied, measured, and improved through targeted research and development.


This field note represents completed research in few-shot learning and compositional generalization. For detailed technical specifications and replication materials, contact: research@iseer.co

Research Status

published

Research Impact

This field note contributes to our ongoing research into capabilities. The findings documented here inform our broader understanding of AI systems and help guide future research directions.

Ask Arete