fix(agent): adapters Claude/Codex au format CLI réel (spikes S1/S2 résolus)

Formats vérifiés sur les vraies CLI le 2026-06-09 :
- Claude (claude -p … --output-format stream-json --verbose ; reprise --resume
  <session_id>) : parse system/init (session_id), ignore rate_limit_event +
  types inconnus, assistant.content[] ITÉRÉ (fix multi-blocs), result→Final.
  Flag --verbose ajouté à build_spawn_line.
- Codex (codex exec --json --skip-git-repo-check ; reprise codex exec resume
  <thread_id>) : thread.started→conversation_id, item.completed/agent_message
  →Final, autres items→ToolActivity, turn.*/inconnu ignorés.

parse_event émet désormais Vec<ReplyEvent> (multi-blocs) ; drain aplatit.
Scripts fake CLI passés aux lignes réelles. Tests : session 46 + intégration,
workspace vert.

À vérifier à l'intégration (D3) : reprise Codex (ordre d'args), et lancement
Codex avec --sandbox workspace-write + approbation non bloquante (hors parsing).

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
2026-06-09 18:34:03 +02:00
parent 751d94dd89
commit f104682477
4 changed files with 437 additions and 236 deletions

View File

@ -1,16 +1,14 @@
//! [`CodexExecSession`] — adapter structuré Codex (ARCHITECTURE §17.2, spike **S2**).
//!
//! Pilote `codex exec` en mode non-interactif et traduit sa sortie structurée vers
//! le contrat universel [`ReplyEvent`]. **Le format de Codex est BEAUCOUP plus
//! incertain que celui de Claude** : tout le format présumé est ISOLÉ dans
//! [`parse_event`], clairement marqué « SUPPOSÉ — à confirmer S2 ».
//! Pilote `codex exec --json` en mode non-interactif et traduit sa sortie structurée
//! vers le contrat universel [`ReplyEvent`]. Le **spike S2 est résolu** : le format
//! réel est vérifié (2026-06-09) et ISOLÉ dans [`parse_event`].
//!
//! # Séparation parsing / machinerie (CRUCIAL — §17.2)
//!
//! Comme pour Claude, la machinerie de process vit dans [`super::process`] et ignore
//! le format. Quand le **spike S2** aura confirmé la sortie réelle (process
//! persistant vs `exec` par tour, schéma JSON de fin de tour), **seule
//! [`parse_event`] (et la composition de la commande) changera**.
//! le format. **Seule [`parse_event`] (et la composition de la commande) porte le
//! format Codex** ; la machinerie reste inchangée.
use std::sync::Mutex;
@ -22,35 +20,36 @@ use domain::SessionId;
use super::process::{run_turn, SpawnLine};
/// Résultat du parsing d'une ligne Codex : un événement (le cas échéant) et/ou un id
/// de conversation Codex capté. Miroir de `claude::ParsedLine`.
/// Résultat du parsing d'une ligne Codex : **zéro ou plusieurs** événements et/ou un
/// id de conversation Codex capté. Miroir de `claude::ParsedLine` (vecteur d'events
/// pour homogénéité du drain ; en pratique Codex rend 0 ou 1 événement par ligne).
#[derive(Debug, Default, PartialEq, Eq)]
pub struct ParsedLine {
/// Événement universel à émettre, ou `None`.
pub event: Option<ReplyEvent>,
/// Id de conversation Codex capté (pour la reprise via le flag Codex).
/// Événements universels à émettre (dans l'ordre), vide pour une ligne de contrôle.
pub events: Vec<ReplyEvent>,
/// Id de conversation Codex capté (= `thread_id`, pour la reprise).
pub conversation_id: Option<String>,
}
/// **Parse une ligne de la sortie structurée de `codex exec`** vers le contrat
/// **Parse une ligne de la sortie structurée de `codex exec --json`** vers le contrat
/// universel.
///
/// # Schéma SUPPOSÉ — à confirmer au spike S2 (format Codex TRÈS incertain)
/// # Format RÉEL vérifié 2026-06-09 (spike S2 résolu)
///
/// On suppose le **minimum viable** : un flux de lignes JSON (JSONL), dont
/// **un** événement final identifiable porte le texte de réponse. Schéma présumé :
/// Commande : `codex exec --json --skip-git-repo-check "<prompt>"` ;
/// reprise : `codex exec resume <thread_id> --json --skip-git-repo-check "<prompt>"`.
///
/// - `{"type":"session","conversation_id":"<id>", …}` (ou `"id"`) ⇒ capte l'id de
/// conversation Codex (pour `--resume`/reprise), **aucun** événement émis.
/// - `{"type":"message"|"delta","text":"…"}` ⇒ [`ReplyEvent::TextDelta`].
/// - `{"type":"tool"|"tool_call","name":"…"}` ⇒ [`ReplyEvent::ToolActivity`].
/// - `{"type":"result"|"final","text":"<texte final>", …}` (ou champ `"output"`)
/// ⇒ [`ReplyEvent::Final`] : **l'événement terminal du tour**.
/// Le flux est du **JSONL**. Types réels :
///
/// > NOTE S2 : ce schéma est **largement présumé**. La forme réelle de `codex exec`
/// > (noms de types, champ portant le texte, présence d'un id de conversation, mode
/// > persistant vs one-shot) est à confirmer au spike. Le contrat de sortie
/// > ([`ReplyEvent`]) ne bougera pas — seule cette fonction changera.
/// - `{"type":"thread.started","thread_id":"<id>"}` ⇒ capte le `thread_id`
/// (= id de conversation pour la reprise), **aucun** événement émis.
/// - `{"type":"turn.started"}` ⇒ ignoré.
/// - `{"type":"item.completed","item":{"id":"item_0","type":"agent_message","text":"…"}}`
/// ⇒ si `item.type=="agent_message"` ⇒ [`ReplyEvent::Final`] (`content` = `item.text`,
/// c'est la réponse) ; sinon (`reasoning`/`command`/autre) ⇒
/// [`ReplyEvent::ToolActivity`] (`label` = `item.type`).
/// - `{"type":"turn.completed","usage":{…}}` ⇒ ignoré (le `Final` vient de
/// l'`agent_message`).
///
/// Ligne vide ⇒ ignorée ; type inconnu ⇒ ignoré sans erreur ; JSON illisible ⇒
/// [`AgentSessionError::Decode`] (jamais de JSON brut propagé).
@ -65,40 +64,42 @@ pub fn parse_event(line: &str) -> Result<ParsedLine, AgentSessionError> {
let value: Value = serde_json::from_str(trimmed)
.map_err(|e| AgentSessionError::Decode(format!("ligne JSON illisible: {e}")))?;
// Id de conversation Codex : on tolère `conversation_id` ou `id` (présumé).
let conversation_id = value
.get("conversation_id")
.or_else(|| value.get("id"))
.and_then(Value::as_str)
.map(str::to_owned);
let mut conversation_id = None;
let mut events = Vec::new();
// Champ texte présumé : `text` en priorité, repli sur `output`.
let text = || {
value
.get("text")
.or_else(|| value.get("output"))
.and_then(Value::as_str)
.unwrap_or_default()
.to_owned()
};
let event = match value.get("type").and_then(Value::as_str) {
Some("session") => None, // handshake : on ne capte que l'id de conversation.
Some("message" | "delta") => Some(ReplyEvent::TextDelta { text: text() }),
Some("tool" | "tool_call") => {
let label = value
.get("name")
match value.get("type").and_then(Value::as_str) {
Some("thread.started") => {
// Handshake : on ne capte que le thread_id (= id de conversation).
conversation_id = value
.get("thread_id")
.and_then(Value::as_str)
.unwrap_or("outil")
.to_owned();
Some(ReplyEvent::ToolActivity { label })
.map(str::to_owned);
}
Some("result" | "final") => Some(ReplyEvent::Final { content: text() }),
_ => None, // type inconnu : ignoré (robustesse).
};
Some("item.completed") => {
if let Some(item) = value.get("item") {
match item.get("type").and_then(Value::as_str) {
Some("agent_message") => {
let content = item
.get("text")
.and_then(Value::as_str)
.unwrap_or_default()
.to_owned();
events.push(ReplyEvent::Final { content });
}
// reasoning / command / tout autre item ⇒ activité (label = type).
Some(kind) => events.push(ReplyEvent::ToolActivity {
label: kind.to_owned(),
}),
None => {}
}
}
}
// turn.started / turn.completed / type inconnu : ignoré (robustesse).
_ => {}
}
Ok(ParsedLine {
event,
events,
conversation_id,
})
}
@ -106,9 +107,9 @@ pub fn parse_event(line: &str) -> Result<ParsedLine, AgentSessionError> {
/// Adapter de session structurée Codex.
///
/// Incarnation « un `codex exec` par tour » (§17.2 (b)) : chaque `send` relance
/// `codex exec` avec le prompt et, dès qu'un id de conversation a été capté, le flag
/// de reprise. L'incarnation « process persistant » resterait derrière le **même**
/// port sans toucher au parsing.
/// `codex exec --json` avec le prompt et, dès qu'un `thread_id` a été capté, la
/// sous-commande de reprise. L'incarnation « process persistant » resterait derrière
/// le **même** port sans toucher au parsing.
pub struct CodexExecSession {
/// Id de session IdeA.
id: SessionId,
@ -140,17 +141,22 @@ impl CodexExecSession {
/// Compose la ligne de commande d'un tour.
///
/// - Conversation neuve : `codex exec <prompt>`.
/// - Reprise (id connu) : `codex exec --resume <id> <prompt>`.
/// Format RÉEL vérifié 2026-06-09 :
/// - Conversation neuve : `codex exec --json --skip-git-repo-check <prompt>`.
/// - Reprise (id connu) : `codex exec resume <thread_id> --json
/// --skip-git-repo-check <prompt>`.
///
/// > NOTE S2 : sous-commande et flags (`exec`, `--resume`, format de sortie
/// > structuré éventuel) **à confirmer au spike**.
/// NOTE intégration (D3, hors parsing) : pour qu'un agent puisse **écrire**, le
/// lancement devra ajouter `--sandbox workspace-write` + une politique
/// d'approbation non bloquante. Ce n'est pas le rôle de cette composition.
fn build_spawn_line(&self, prompt: &str) -> SpawnLine {
let mut args = vec!["exec".to_owned()];
if let Some(id) = self.conversation_id.lock().expect("mutex sain").as_ref() {
args.push("--resume".to_owned());
args.push("resume".to_owned());
args.push(id.clone());
}
args.push("--json".to_owned());
args.push("--skip-git-repo-check".to_owned());
args.push(prompt.to_owned());
SpawnLine {
command: self.command.clone(),
@ -183,9 +189,7 @@ impl AgentSession for CodexExecSession {
if let Some(id) = parsed.conversation_id {
captured_id = Some(id);
}
if let Some(event) = parsed.event {
events.push(event);
}
events.extend(parsed.events);
}
if let Some(id) = captured_id {
*self.conversation_id.lock().expect("mutex sain") = Some(id);