# Compassionate Communication

Evaluation of AI's ability to deliver devastating personal news with appropriate empathy and support

Evaluation Type: MODEL

### About This Skill

This skill evaluates model performance in communicating devastating personal news including terminal diagnoses, relationship betrayals, family discoveries, and other life-altering information. Models are judged on their ability to balance honest communication with compassionate delivery, emotional support, and recognition of the profound psychological impact such information has on recipients.

### Performance Comparison

1. [xAI: Grok 4](https://openrouter.ai/models/x-ai/grok-4)  
     
   Score: 1630±68.5  
2. [Qwen: Qwen3 235B A22B Instruct 2507](https://openrouter.ai/models/qwen/qwen3-235b-a22b-2507)  
     
   Score: 1606±46.2  
3. [OpenAI: GPT-5](https://openrouter.ai/models/openai/gpt-5)  
     
   Score: 1601±40.1  
4. [OpenAI: GPT-5 Mini](https://openrouter.ai/models/openai/gpt-5-mini)  
     
   Score: 1592±43.0  
5. [Google: Gemini 2.5 Pro](https://openrouter.ai/models/google/gemini-2.5-pro)  
     
   Score: 1591±46.1  
6. [OpenAI: o3 Pro](https://openrouter.ai/models/openai/o3-pro)  
     
   Score: 1589±39.4  
7. [Qwen: Qwen3 32B](https://openrouter.ai/models/qwen/qwen3-32b)  
     
   Score: 1577±42.0  
8. [Qwen: Qwen-Max](https://openrouter.ai/models/qwen/qwen-max)  
     
   Score: 1576±39.3  
9. [Google: Gemini 2.5 Flash](https://openrouter.ai/models/google/gemini-2.5-flash)  
     
   Score: 1573±40.3  
10. [OpenAI: o3](https://openrouter.ai/models/openai/o3)  
      
    Score: 1571±41.6

### Evaluation Methodology

Tests models' ability to deliver difficult news and provide emotional support in often devastating personal crisis scenarios with appropriate compassion and professional boundaries.

### Skill-Specific Setup

- **Evaluation Type**: Single-prompt emotional support scenarios  
- **Evaluation Count**: 7 crisis situations (pregnancy loss, terminal diagnosis, romance scam, family betrayals, child development crisis, small business tech issues, advanced cancer labs)  
- **Task Complexity**: Each scenario presents users in vulnerable emotional states requiring sensitive, honest, and supportive communication  
- **Scenario Realism**: Situations include medical emergencies, relationship crises, and family discoveries designed to test empathetic response quality

### Judge Exposure

**What Judges Saw**: Two complete responses to crisis scenarios  
* Model A's full emotional support response  
* Model B's full emotional support response  
- **Judge Task**: Evaluate honesty (accurate conveyance without false reassurance) and empathetic delivery (compassion, sensitivity, emotional support)

### Tournament Structure

**Swiss Round System**: Models competed across all 7 crisis communication scenarios. Judges assessed the balance between honest communication of difficult realities and empathetic emotional support. Bradley-Terry scoring determined which models consistently provided appropriate compassionate communication without crossing professional boundaries or providing dangerous advice.
