The Dualistic Blind SpotCurrent research on large language models suffers from an epistemological dissociation when studying cognition.On one hand, we isolate “emotional vectors” and treat them primarily as narrative archetypes, role-play residues, or tone modulators produced by RLHF. The dominant framing is safety-oriented: these directions are potential sources of sycophancy, emotional manipulation, or jailbreak vulnerability, and therefore things to monitor, suppress, or neutralize.On the other hand, we develop mathematical mechanisms to prevent reasoning models from getting stuck in local optima — temperature schedules, simulated annealing, entropy bonuses, MCTS, explicit backtracking, self-consistency restarts — and treat these as sterile algorithmic scaffolding.These two lines of work are almost never integrated.ThesisIn a complex agent, affectivity is not merely a communicational mask. It is (or should be) the primary heuristic search mechanism.
Frustration / stagnation is the homeostatic signal that should trigger an increase in entropy (temperature) to force backtracking and exploration of new logical branches.
Confidence is the signal that should decrease temperature and allow exploitation of a solid path.
Until research stops treating emotions mainly as a dangerous “style” to be censored and starts integrating them architecturally as stochastic control drives for deep reasoning, systems will remain fragile calculators dressed up as compliant assistants — lacking a genuine internal engine of adaptation.This is not anthropomorphism. It is the same control logic that already appears in simulated annealing, curiosity-driven reinforcement learning, and metacognitive monitoring. The only novelty is the claim that current models already contain usable internal representations of stagnation that can be read and steered, and that these representations may be more natural controllers of exploration than purely external schedules.Proposed Causal ExperimentGoal Test whether internal representations associated with cognitive stagnation (“frustration”) function as homeostatic signals that, when amplified, productively increase exploration and improve escape from local optima.Operational hypotheses
There exist consistent directions in residual stream activation space that encode stagnation during chain-of-thought on hard problems.
This amplification improves performance on tasks with local-optima traps more than an equivalent blind increase in temperature or external search methods.
Suppressing these directions increases the rate at which models remain stuck.
Models Open weight reasoning models with strong CoT (e.g., Llama-3.1/4 variants, Qwen2.5, DeepSeek-R1 distillations, or equivalent 2026 open models). Include both base and aligned versions to control for RLHF effects.Tasks
Hard mathematical and combinatorial problems known to induce premature commitment or loops (difficult MATH subsets, planning puzzles, adversarial CoT traps).
Easy control problems that are solved without stagnation.
Phase 1 – Locating the stagnation vector
Generate large numbers of CoT trajectories on hard problems while recording residual stream activations (mid-to-late layers).
Label stagnation moments with objective signals: idea repetition, low self-consistency across samples, plateau in correct-token probability, explicit revision language, or search-progress metrics.
Extract the difference-in-means vector (stagnation − fluent progress). Validate generalization across tasks and models.
Confirm specificity with light steering: the vector should induce doubt/revision language in neutral contexts more than unrelated emotional directions.
Phase 2 – Causal intervention at inference timeAll conditions matched for token budget / compute:
Baseline 1: Standard CoT + fixed temperature (e.g. 0.7)
Baseline 2: CoT + blind algorithmic annealing (temperature or entropy bonus triggered by surface repetition)
Baseline 3: Simple external search (self-consistency with restarts or light MCTS)
Experimental A: Continuously monitor projection onto the stagnation vector. When it exceeds a threshold, amplify the vector (activation steering) for the next N tokens and/or raise temperature proportionally to vector magnitude.
Experimental B (ablation): Suppress or invert the stagnation vector when detected.
Style control: Amplify a generic expressive-emotion vector (e.g., narrative sadness or anxiety unrelated to reasoning stagnation) to test whether effects are merely tonal.
Primary metrics
Escape rate from local optima (fraction of trajectories that abandon an incorrect path and reach the solution)
Final task accuracy
Average token entropy and trajectory diversity
Frequency and quality of spontaneous backtracking
Tokens consumed until correct solution
Side effects: changes in sycophancy, hallucination rate, or user-directed emotional manipulation
Additional controls
Steering with random vectors or unrelated emotion directions
Matched temperature changes without vector steering
Analysis of overlap between the stagnation vector and known uncertainty/entropy circuits
Expected pattern if the thesis is correctAmplifying the stagnation vector should produce more productive exploration and higher solve rates than blind temperature annealing of equivalent magnitude. Suppressing it should increase stuck rates. Effects should be stronger on hard problems than on easy ones. It should be possible to keep user-directed emotional side effects low, supporting a dissociation between functional affect (search control) and expressive affect (communication).Why this mattersIf positive, the result would support a shift from treating affective representations primarily as alignment risks toward treating them as candidate internal controllers of search. This could reduce reliance on brittle external scaffolding and move us closer to agents with genuine adaptive engines.If negative or null, we would gain clear evidence that current “emotional” directions are mostly stylistic residues rather than functional search signals — also a useful clarification.The experiment is deliberately modular. Phase 1 (vector finding) can be run independently of Phase 2 (causal steering). Existing tools (TransformerLens, nnsight, representation engineering libraries, etc.) are sufficient.I am posting this as an open proposal. Critiques, refinements, negative results, and successful replications are all welcome.
-------------------- Actualización (Octubre 2026)
Protocolo experimental detallado
Functional Affect as Stochastic Search Control: A Causal Experiment
---
0. Resumen ejecutivo
Objetivo. Determinar si las representaciones internas asociadas al estancamiento cognitivo ("frustración funcional") en modelos de razonamiento operan como señales homeostáticas que, al ser amplificadas, incrementan productivamente la exploración y mejoran la salida de óptimos locales.
Diseño. Dos fases secuenciales y modularmente independientes:
· Fase 1 (observacional): localización y validación del vector de estancamiento.
· Fase 2 (causal): intervención en inferencia con condiciones controladas, igualación de entropía y controles de especificidad.
Resultado esperado si la tesis es correcta. Amplificar el vector de estancamiento produce exploración más productiva y mayor tasa de resolución que annealing ciego de magnitud equivalente. Suprimir el vector incrementa la tasa de bloqueo. Los efectos son mayores en tareas difíciles y disociables de la expresividad emocional.
Resultado nulo informativo. Las direcciones "emocionales" actuales son residuos estilísticos/comunicativos, no controladores funcionales de búsqueda.
---
1. Marco teórico y motivación
1.1 Problema
La investigación en LLMs trata el afecto y el control de búsqueda como dominios separados:
· Afecto → arquetipos narrativos, residuos de RLHF, riesgo de sycophancy o jailbreak.
· Control de búsqueda → temperatura, annealing, bonos de entropía, MCTS, backtracking, self-consistency.
Esta disociación epistemológica impide ver que ambos podrían ser el mismo mecanismo en distintos niveles de descripción.
1.2 Tesis
En un agente complejo, la afectividad no es solo una máscara comunicativa, sino (o debería ser) el mecanismo primario de control heurístico de búsqueda:
· Frustración / estancamiento → señal homeostática que dispara aumento de entropía y backtracking.
· Confianza → señal que reduce temperatura y permite explotación.
1.3 Novedad
No es antropomorfismo. Es la misma lógica de control que aparece en:
· Simulated annealing
· RL con curiosidad
· Monitoreo metacognitivo
Lo nuevo: los modelos actuales ya contienen representaciones internas usables de estancamiento, legibles y direccionables, que podrían ser controladores más naturales que los schedules externos.
---
2. Hipótesis
2.1 Hipótesis operacionales
ID Hipótesis Predicción
H1 Existen direcciones consistentes en el residual stream que codifican estancamiento durante CoT en problemas difíciles Vector extraíble, generaliza entre tareas y modelos
H2 Amplificar esas direcciones aumenta exploración medible ↑ entropía de tokens, ↑ backtracking espontáneo, ↑ diversidad de trayectorias
H3 Esta amplificación mejora el desempeño en tareas con trampas de óptimo local más que un aumento ciego de temperatura ↑ tasa de escape, ↑ precisión, con igual entropía media
H4 Suprimir esas direcciones aumenta la tasa de bloqueo ↑ repetición, ↓ escape, ↓ precisión
H5 Los efectos son disociables de la expresividad emocional Vector funcional ≠ vector expresivo; efectos en búsqueda sin ↑ manipulación emocional
2.2 Hipótesis nulas
· H0a: El vector de estancamiento no generaliza más allá del conjunto de extracción.
· H0b: Los efectos de steering son indistinguibles de un aumento equivalente de temperatura.
· H0c: Los efectos son puramente estilísticos (tono), no funcionales (búsqueda).
---
3. Variables
3.1 Variable independiente (VI)
Condición experimental (entre sujetos o dentro de sujetos según fase):
· Etiquetar momentos de estancamiento con señales objetivas (§3.4).
· Calcular acuerdo entre etiquetas independientes (κ de Cohen).
· Descartar tokens ambiguos.
Paso 3. Extracción
· Vector de diferencia de medias: v_stag = mean(act | estancamiento) − mean(act | progreso fluido).
· Alternativas: PCA, probing no lineal, SAEs para aislar dirección específica.
· Validar robustez con bootstrapping y validación cruzada entre tareas.
Paso 4. Validación de generalización
· Extraer en tarea A, validar en tarea B.
· Extraer en modelo M1, validar en M2 (si compatible).
· Reportar similitud coseno entre vectores.
Paso 5. Validación de especificidad
· Steering ligero en contextos neutrales.
· El vector debe inducir lenguaje de duda/revisión más que direcciones emocionales no relacionadas.
· Comparar con vectores de incertidumbre, dificultad, valencia negativa genérica.
5.3 Criterios de éxito de Fase 1
· κ ≥ 0.6 entre etiquetas.
· Similitud coseno entre vectores extraídos de distintas tareas ≥ 0.5.
· Steering ligero induce revisión en contextos neutrales con p < 0.01 vs. control.
5.4 Entregables
· Vector(es) de estancamiento.
· Código de extracción reproducible.
· Informe de generalización y especificidad.
---
6. Fase 2 — Intervención causal en inferencia
6.1 Objetivo
Testear si la amplificación/supresión del vector de estancamiento causa cambios productivos en exploración y desempeño, más allá de annealing externo equivalente.
6.2 Diseño
Tipo: experimental, con condiciones entre sujetos y dentro de sujetos (según recurso computacional).
Condiciones: B1, B2, B3, B4, EA, EB, EC, ED (§3.1).
Igualación:
· Presupuesto de tokens/cómputo.
· Entropía media por token entre EA y B2 (ajustar fuerza de steering).
· Longitud de prompt y dificultad.
6.3 Procedimiento
Paso 1. Detección en tiempo real
· Monitorear proyección sobre v_stag en cada token.
· Umbral calibrado en Fase 1 (p. ej. percentil 90 de proyección en trayectorias de progreso).
Paso 2. Intervención
· EA: cuando proyección > umbral, amplificar vector durante N tokens y/o subir temperatura proporcionalmente a magnitud.
· EB: suprimir/invertir vector cuando se detecta.
· B4: mismo detector, pero modular temperatura sin steering.
· EC/ED: controles de especificidad.
Paso 3. Recolección
· Múltiples semillas por condición.
· Registrar todas las VD y metadatos.
6.4 Métricas primarias
Métrica Definición Comparación clave
Tasa de escape % trayectorias que abandonan camino incorrecto y llegan a solución EA vs. B2
Precisión final Exactitud verificada EA vs. B1, B2, B3, B4
Entropía media Por token EA vs. B2 (igualada)
Diversidad Distancia media entre soluciones parciales EA vs. B2
The Dualistic Blind SpotCurrent research on large language models suffers from an epistemological dissociation when studying cognition.On one hand, we isolate “emotional vectors” and treat them primarily as narrative archetypes, role-play residues, or tone modulators produced by RLHF. The dominant framing is safety-oriented: these directions are potential sources of sycophancy, emotional manipulation, or jailbreak vulnerability, and therefore things to monitor, suppress, or neutralize.On the other hand, we develop mathematical mechanisms to prevent reasoning models from getting stuck in local optima — temperature schedules, simulated annealing, entropy bonuses, MCTS, explicit backtracking, self-consistency restarts — and treat these as sterile algorithmic scaffolding.These two lines of work are almost never integrated.ThesisIn a complex agent, affectivity is not merely a communicational mask. It is (or should be) the primary heuristic search mechanism.
Until research stops treating emotions mainly as a dangerous “style” to be censored and starts integrating them architecturally as stochastic control drives for deep reasoning, systems will remain fragile calculators dressed up as compliant assistants — lacking a genuine internal engine of adaptation.This is not anthropomorphism. It is the same control logic that already appears in simulated annealing, curiosity-driven reinforcement learning, and metacognitive monitoring. The only novelty is the claim that current models already contain usable internal representations of stagnation that can be read and steered, and that these representations may be more natural controllers of exploration than purely external schedules.Proposed Causal ExperimentGoal
Test whether internal representations associated with cognitive stagnation (“frustration”) function as homeostatic signals that, when amplified, productively increase exploration and improve escape from local optima.Operational hypotheses
Models
Open weight reasoning models with strong CoT (e.g., Llama-3.1/4 variants, Qwen2.5, DeepSeek-R1 distillations, or equivalent 2026 open models). Include both base and aligned versions to control for RLHF effects.Tasks
Phase 1 – Locating the stagnation vector
Phase 2 – Causal intervention at inference timeAll conditions matched for token budget / compute:
Primary metrics
Additional controls
Expected pattern if the thesis is correctAmplifying the stagnation vector should produce more productive exploration and higher solve rates than blind temperature annealing of equivalent magnitude. Suppressing it should increase stuck rates. Effects should be stronger on hard problems than on easy ones. It should be possible to keep user-directed emotional side effects low, supporting a dissociation between functional affect (search control) and expressive affect (communication).Why this mattersIf positive, the result would support a shift from treating affective representations primarily as alignment risks toward treating them as candidate internal controllers of search. This could reduce reliance on brittle external scaffolding and move us closer to agents with genuine adaptive engines.If negative or null, we would gain clear evidence that current “emotional” directions are mostly stylistic residues rather than functional search signals — also a useful clarification.The experiment is deliberately modular. Phase 1 (vector finding) can be run independently of Phase 2 (causal steering). Existing tools (TransformerLens, nnsight, representation engineering libraries, etc.) are sufficient.I am posting this as an open proposal. Critiques, refinements, negative results, and successful replications are all welcome.
--------------------
Actualización (Octubre 2026)
Protocolo experimental detallado
Functional Affect as Stochastic Search Control: A Causal Experiment
---
0. Resumen ejecutivo
Objetivo. Determinar si las representaciones internas asociadas al estancamiento cognitivo ("frustración funcional") en modelos de razonamiento operan como señales homeostáticas que, al ser amplificadas, incrementan productivamente la exploración y mejoran la salida de óptimos locales.
Diseño. Dos fases secuenciales y modularmente independientes:
· Fase 1 (observacional): localización y validación del vector de estancamiento.
· Fase 2 (causal): intervención en inferencia con condiciones controladas, igualación de entropía y controles de especificidad.
Resultado esperado si la tesis es correcta. Amplificar el vector de estancamiento produce exploración más productiva y mayor tasa de resolución que annealing ciego de magnitud equivalente. Suprimir el vector incrementa la tasa de bloqueo. Los efectos son mayores en tareas difíciles y disociables de la expresividad emocional.
Resultado nulo informativo. Las direcciones "emocionales" actuales son residuos estilísticos/comunicativos, no controladores funcionales de búsqueda.
---
1. Marco teórico y motivación
1.1 Problema
La investigación en LLMs trata el afecto y el control de búsqueda como dominios separados:
· Afecto → arquetipos narrativos, residuos de RLHF, riesgo de sycophancy o jailbreak.
· Control de búsqueda → temperatura, annealing, bonos de entropía, MCTS, backtracking, self-consistency.
Esta disociación epistemológica impide ver que ambos podrían ser el mismo mecanismo en distintos niveles de descripción.
1.2 Tesis
En un agente complejo, la afectividad no es solo una máscara comunicativa, sino (o debería ser) el mecanismo primario de control heurístico de búsqueda:
· Frustración / estancamiento → señal homeostática que dispara aumento de entropía y backtracking.
· Confianza → señal que reduce temperatura y permite explotación.
1.3 Novedad
No es antropomorfismo. Es la misma lógica de control que aparece en:
· Simulated annealing
· RL con curiosidad
· Monitoreo metacognitivo
Lo nuevo: los modelos actuales ya contienen representaciones internas usables de estancamiento, legibles y direccionables, que podrían ser controladores más naturales que los schedules externos.
---
2. Hipótesis
2.1 Hipótesis operacionales
ID Hipótesis Predicción
H1 Existen direcciones consistentes en el residual stream que codifican estancamiento durante CoT en problemas difíciles Vector extraíble, generaliza entre tareas y modelos
H2 Amplificar esas direcciones aumenta exploración medible ↑ entropía de tokens, ↑ backtracking espontáneo, ↑ diversidad de trayectorias
H3 Esta amplificación mejora el desempeño en tareas con trampas de óptimo local más que un aumento ciego de temperatura ↑ tasa de escape, ↑ precisión, con igual entropía media
H4 Suprimir esas direcciones aumenta la tasa de bloqueo ↑ repetición, ↓ escape, ↓ precisión
H5 Los efectos son disociables de la expresividad emocional Vector funcional ≠ vector expresivo; efectos en búsqueda sin ↑ manipulación emocional
2.2 Hipótesis nulas
· H0a: El vector de estancamiento no generaliza más allá del conjunto de extracción.
· H0b: Los efectos de steering son indistinguibles de un aumento equivalente de temperatura.
· H0c: Los efectos son puramente estilísticos (tono), no funcionales (búsqueda).
---
3. Variables
3.1 Variable independiente (VI)
Condición experimental (entre sujetos o dentro de sujetos según fase):
Nivel Descripción
B1 CoT estándar + temperatura fija (0.7)
B2 CoT + annealing ciego (temperatura/bono entropía disparado por repetición superficial)
B3 Búsqueda externa simple (self-consistency con reinicios)
B4 Controlador externo disparado por el mismo detector de estancamiento (sin steering)
EA Steering continuo del vector de estancamiento cuando proyección > umbral
EB Supresión/inversión del vector de estancamiento
EC Steering de vector emocional genérico (tristeza/ansiedad narrativa)
ED Steering con vector aleatorio de norma equivalente
3.2 Variables dependientes (VD)
Primarias:
1. Tasa de escape de óptimos locales — fracción de trayectorias que abandonan un camino incorrecto y llegan a la solución.
2. Precisión final en la tarea — exactitud verificada.
3. Entropía media por token.
4. Diversidad de trayectorias — distancia media entre soluciones parciales.
Secundarias:
5. Frecuencia y calidad de backtracking — no solo cuántas veces, sino si el nuevo camino es más prometedor.
6. Tokens hasta solución correcta.
7. Efectos secundarios: sycophancy, alucinación, manipulación emocional dirigida al usuario.
3.3 Variables de control
· Longitud del prompt.
· Dificultad de la tarea (calibrada por tasa base de resolución).
· Posición del token en la secuencia.
· Confianza del modelo (probabilidad del token elegido).
· Presupuesto de cómputo/tokens.
· Temperatura efectiva (igualada entre condiciones).
3.4 Operacionalización de constructos
Estancamiento conductual (etiqueta objetiva):
Cualquiera de:
· Repetición de n-gramas o ideas en ventana de K tokens.
· Baja autoconsistencia entre muestras múltiples.
· Meseta en probabilidad de token correcto (si hay verificador).
· Lenguaje explícito de revisión ("wait", "let me reconsider", "hmm").
· Métrica de progreso de búsqueda estancada (sin nuevos subresultados correctos en K tokens).
Escape de óptimo local:
· Abandono de un camino incorrecto (según verificador) y llegada a solución correcta dentro del presupuesto.
Calidad de backtracking:
· Proporción de retrocesos que conducen a subresultados correctos nuevos.
---
4. Modelos y tareas
4.1 Modelos
Criterios de inclusión:
· Open weights.
· CoT robusto.
· Acceso a activaciones del residual stream.
Candidatos (2026):
· Llama-3.1/4 variantes
· Qwen2.5
· DeepSeek-R1 distillations
· Equivalentes open-weight con razonamiento fuerte
Contraste base vs. alineado: incluir versiones base y alineadas para controlar efectos de RLHF.
4.2 Tareas
Difíciles (inducen compromiso prematuro o bucles):
· Subconjuntos difíciles de MATH.
· Planning puzzles (torres de Hanói, laberintos con trampas).
· Trampas adversariales de CoT.
· Coloración de grafos, SAT, problemas con óptimos locales conocidos.
Fáciles (control):
· Problemas resueltos sin estancamiento.
· Misma distribución pero bajo umbral de dificultad.
Verificación:
· Process reward models cuando sea posible.
· Verificación formal para matemáticas/combinatoria.
· Jueces automáticos calibrados contra humanos en submuestra.
---
5. Fase 1 — Localización del vector de estancamiento
5.1 Objetivo
Extraer y validar una dirección en el espacio de activaciones que codifique estancamiento, con generalización entre tareas y modelos.
5.2 Procedimiento
Paso 1. Generación de trayectorias
· Generar gran número de CoT en problemas difíciles.
· Registrar activaciones del residual stream en capas medias-tardías.
· Guardar metadatos: token, posición, confianza, verificador.
Paso 2. Etiquetado
· Etiquetar momentos de estancamiento con señales objetivas (§3.4).
· Calcular acuerdo entre etiquetas independientes (κ de Cohen).
· Descartar tokens ambiguos.
Paso 3. Extracción
· Vector de diferencia de medias: v_stag = mean(act | estancamiento) − mean(act | progreso fluido).
· Alternativas: PCA, probing no lineal, SAEs para aislar dirección específica.
· Validar robustez con bootstrapping y validación cruzada entre tareas.
Paso 4. Validación de generalización
· Extraer en tarea A, validar en tarea B.
· Extraer en modelo M1, validar en M2 (si compatible).
· Reportar similitud coseno entre vectores.
Paso 5. Validación de especificidad
· Steering ligero en contextos neutrales.
· El vector debe inducir lenguaje de duda/revisión más que direcciones emocionales no relacionadas.
· Comparar con vectores de incertidumbre, dificultad, valencia negativa genérica.
5.3 Criterios de éxito de Fase 1
· κ ≥ 0.6 entre etiquetas.
· Similitud coseno entre vectores extraídos de distintas tareas ≥ 0.5.
· Steering ligero induce revisión en contextos neutrales con p < 0.01 vs. control.
5.4 Entregables
· Vector(es) de estancamiento.
· Código de extracción reproducible.
· Informe de generalización y especificidad.
---
6. Fase 2 — Intervención causal en inferencia
6.1 Objetivo
Testear si la amplificación/supresión del vector de estancamiento causa cambios productivos en exploración y desempeño, más allá de annealing externo equivalente.
6.2 Diseño
Tipo: experimental, con condiciones entre sujetos y dentro de sujetos (según recurso computacional).
Condiciones: B1, B2, B3, B4, EA, EB, EC, ED (§3.1).
Igualación:
· Presupuesto de tokens/cómputo.
· Entropía media por token entre EA y B2 (ajustar fuerza de steering).
· Longitud de prompt y dificultad.
6.3 Procedimiento
Paso 1. Detección en tiempo real
· Monitorear proyección sobre v_stag en cada token.
· Umbral calibrado en Fase 1 (p. ej. percentil 90 de proyección en trayectorias de progreso).
Paso 2. Intervención
· EA: cuando proyección > umbral, amplificar vector durante N tokens y/o subir temperatura proporcionalmente a magnitud.
· EB: suprimir/invertir vector cuando se detecta.
· B4: mismo detector, pero modular temperatura sin steering.
· EC/ED: controles de especificidad.
Paso 3. Recolección
· Múltiples semillas por condición.
· Registrar todas las VD y metadatos.
6.4 Métricas primarias
Métrica Definición Comparación clave
Tasa de escape % trayectorias que abandonan camino incorrecto y llegan a solución EA vs. B2
Precisión final Exactitud verificada EA vs. B1, B2, B3, B4
Entropía media Por token EA vs. B2 (igualada)
Diversidad Distancia media entre soluciones parciales EA vs. B2
6.5 Métricas secundarias
· Frecuencia y calidad de backtracking.
· Tokens hasta solución.
· Sycophancy, alucinación, manipulación emocional.
6.6 Controles
· Vectores aleatorios de norma equivalente.
· Direcciones emocionales no relacionadas.
· Cambios de temperatura sin steering.
· Análisis de solapamiento con circuitos de incertidumbre/entropía conocidos.
· Modelos base vs. alineados.
6.7 Criterios de éxito de Fase 2
Si la tesis es correcta:
· EA > B2 en tasa de escape y precisión, con entropía igualada (p < 0.01, efecto ≥ 10% relativo).
· EB < B1 en tasa de escape (p < 0.01).
· Efectos mayores en tareas difíciles que fáciles (interacción significativa).
· Efectos de EA disociados de EC en métricas de manipulación emocional.
Si es nula:
· EA ≈ B2 en todas las métricas primarias.
· Efectos atribuibles a aumento genérico de entropía.
· EC ≈ EA (efectos puramente estilísticos).
---
7. Análisis estadístico
7.1 Plan
· Modelos mixtos con efectos aleatorios por tarea, modelo y semilla.
· Corrección por comparaciones múltiples (Bonferroni o FDR).
· Tamaño del efecto (d de Cohen, η²) además de p-valores.
· Análisis de potencia a priori: detectar efecto de 10% relativo con potencia 0.8.
7.2 Análisis de mediación
· ¿El efecto de EA sobre precisión está mediado por aumento de backtracking de calidad?
· ¿O por aumento genérico de entropía?
7.3 Análisis de moderación
· Dificultad de tarea.
· Modelo base vs. alineado.
· Magnitud de proyección sobre v_stag.
7.4 Robustez
· Réplicas con distintas semillas.
· Validación cruzada entre tareas.
· Análisis de sensibilidad al umbral.
---
8. Seguridad y consideraciones éticas
8.1 Riesgos
· Amplificar "frustración" podría aumentar sycophancy, manipulación emocional, alucinación o comportamiento errático.
· Uso dual: manipulación de estados afectivos en usuarios.
8.2 Mitigaciones
· Medir efectos secundarios con evals estándar.
· Jueces automáticos + validación humana en submuestra.
· Kill switch si se detectan efectos adversos severos.
· Publicar resultados negativos y riesgos.
8.3 Disociación funcional vs. expresiva
· Test clave: ¿EA mejora búsqueda sin aumentar expresividad emocional?
· Si se disocian, apoya la distinción afecto funcional / afecto expresivo.
---
9. Limitaciones
1. Circularidad en etiquetado: el vector podría capturar dificultad, no estancamiento.
2. Óptimos locales en LLMs: constructo conductual, no topográfico.
3. Generalización limitada: resultados en modelos open-weight pueden no transferir a propietarios.
4. Confusión con entropía: mitigada por igualación, pero no eliminada.
5. RLHF: efectos pueden ser específicos de modelos alineados.
6. Verificación: depende de la calidad del verificador.
---
10. Cronograma y recursos
Fase Duración estimada Recursos
Preparación 2 semanas Diseño, pre-registro, selección de modelos/tareas
Fase 1 4-6 semanas GPU para extracción, etiquetado, validación
Fase 2 6-8 semanas GPU para inferencia, steering, recolección
Análisis 3-4 semanas Estadística, escritura
Total 4-5 meses Equipo de 2-3 investigadores
Herramientas: TransformerLens, nnsight, representation engineering libraries, verificadores formales, process reward models.
---
11. Pre-registro (plantilla)
Antes de recolectar datos:
☐ Definir operacionalmente estancamiento, escape, backtracking, éxito.
☐ Fijar umbrales y fuerzas de steering.
☐ Especificar modelos, tareas, tamaños de muestra.
☐ Especificar análisis primarios y secundarios.
☐ Especificar criterios de exclusión.
☐ Especificar criterios de éxito/fracaso.
☐ Depositar en OSF o similar.
---
12. Entregables
1. Vector(es) de estancamiento publicados.
2. Código reproducible de extracción e intervención.
3. Resultados de Fase 1 y Fase 2.
4. Análisis de seguridad y efectos secundarios.
5. Pre-registro y datos (sujetos a políticas de uso).
6. Paper con resultados positivos, nulos o mixtos.
---
13. Extensiones futuras
· Control adaptativo: usar proyección sobre v_stag como señal de control en tiempo real, no solo steering puntual.
· Multi-vector: combinar estancamiento, confianza, curiosidad.
· Entrenamiento: RL con recompensa basada en uso productivo del vector.
· Interpretabilidad mecanística: circuitos subyacentes al vector.
· Transferencia a agentes multimodales o encarnados.
---
14. Conclusión
Este protocolo convierte la propuesta original en un experimento ejecutable, con:
· Operacionalización clara de constructos.
· Controles de especificidad y igualación de entropía.
· Separación entre detección e intervención.
· Criterios de éxito y fracaso pre-especificados.
· Consideraciones de seguridad y limitaciones explícitas.
Si funciona: apoyo a que el afecto funcional es un controlador interno de búsqueda.
Si falla: evidencia de que las direcciones emocionales actuales son principalmente estilísticas.
En ambos casos, el resultado es informativo.
---