Cadre - trace brute assainie

Rapport comparatif complet

Contenu conserve tel que produit. Seules les eventuelles adresses et chemins internes sont neutralises pour la publication.

# Rapport final — La balise du dernier jardin, équipe locale

## Provenance

Cette seconde exécution a été réalisée uniquement par les six modèles Ollama locaux retenus : `qwen2.5:7b`, `qwen2.5-coder:14b`, `gemma3:12b`, `qwen3:14b`, `phi4:14b` et `gpt-oss:20b`. Aucune sous-agente Codex n'a produit le contenu.

## Résultat local

La proposition finale s'appelle **Écho de Verdure** : une borne en bois massif alimentée par panneau solaire et batterie, activée par mouvement, munie de LED, d'une enceinte et éventuellement d'un microphone et d'un écran LCD. Elle adresse un message écologique général et reconnaît deux limites : le remplacement de la batterie et la sensibilité du capteur dans une végétation dense.

## Verdict du juge local

- Verdict : **PARTIEL**
- Note : **8/10**
- Décision : **réviser**

## Audit d'Iris, coordinatrice

### Ce qui fonctionne

- Les cinq rôles de production ont réellement été distribués à cinq modèles différents.
- Le passage d'une sortie à la suivante est traçable.
- Gemma fournit une voix claire et naturelle.
- Qwen3 repère plusieurs risques réels : provenance des matériaux, installation, batterie, réparabilité et décalage récit/technique.
- La reprise de Phi produit finalement les sept sections demandées.

### Ce qui échoue ou reste faible

- Qwen légère transforme le « dernier jardin » en campagne générique de sensibilisation destinée aux jeunes.
- Qwen codeuse ajoute LED clignotante, enceinte, microphone, écran LCD et alarme : une solution intrusive, peu sobre et mal adaptée à la protection d'un dernier refuge vivant.
- Le prétendu « système auto-réparateur » ne répare rien ; il ne fait que détecter une panne.
- Gemma rend le concept agréable mais ne corrige pas sa contradiction écologique.
- Qwen3 critique justement plusieurs défauts, mais accorde des notes trop élevées et pousse vers davantage d'urgence sonore plutôt que vers davantage de discrétion.
- Phi échoue au premier passage en recopiant presque entièrement la revue au lieu de synthétiser. Une reprise ciblée a été nécessaire.
- GPT-OSS échoue au premier passage : format non respecté et inventions absentes du dossier. Une reprise ciblée a été nécessaire.
- Même après reprise, Phi conserve les éléments les plus intrusifs et ne corrige pas réellement la proposition.
- GPT-OSS attribue 8/10 sans relever les deux échecs de rôle ni le contresens central sur la protection du jardin.

## Comparaison avec le premier test Codex

| Axe | Agentes Codex spécialisées | Véritable équipe locale |
|---|---|---|
| Singularité | Forte : balise protectrice qui sait s'éteindre | Faible : borne pédagogique écologique générique |
| Sobriété | Capteurs minimaux, aucune connexion, lumière faible | LED, audio, microphone et LCD optionnels |
| Protection du lieu | Centrale : ne pas révéler l'adresse du vivant | Secondaire : attirer et sensibiliser le public |
| Critique | Limite fondamentale reconnue | Risques listés mais insuffisamment corrigés |
| Respect des rôles | Bon dès le premier passage | Deux reprises nécessaires |
| Jugement | 9,2/10 par Iris | 8/10 par GPT-OSS ; **5,5/10 après audit d'Iris** |

## Verdict coordonné

**PARTIEL — 5,5/10 — RÉVISER.**

La vraie équipe locale sait déjà enchaîner cadrage, technique, narration, revue, synthèse et jugement. Elle ne sait pas encore protéger l'intention centrale contre la dérive générique, ni transformer correctement une critique en correction. Le prochain progrès prioritaire concerne l'orchestration : contrats de rôle plus stricts, critères écologiques bloquants, détection des contresens et juge mieux calibré.