Manual del Motor de Contenido con IA

Material de estudio para el rol de Founding AI Content Operations Lead · Isaac Hernández

← Volver a la guía de la entrevista (20 min)

Capítulo 1

El modelo: una pieza pilar, decenas de micro-piezas

Lo que WON quiere construir tiene tres nombres que conviven en la industria: content repurposing at scale, content OS (o content engine) y founder-led content operations. La arquitectura es siempre la misma pirámide invertida: una grabación larga se disecciona en decenas de piezas adaptadas a cada plataforma.

El documento fundacional: el GaryVee Content Model

El antecedente público más citado es el modelo de VaynerMedia (2018). Una pieza pilar (keynote, podcast, reunión) produce 30 o más piezas distribuidas en 6 a 10 plataformas. Un solo keynote de Gary Vaynerchuk generó más de 30 piezas y 35 millones de vistas. Es exactamente lo que pide WON, con la diferencia de que ellos quieren hacerlo con IA en vez de con un equipo grande.

Las tres capas del modelo:

1. Pilar → contenido largo y con sustancia (60 a 120 min).
2. Micro → clips, quotes, carruseles, posts derivados del pilar.
3. Distribución → cada micro-pieza adaptada al formato nativo de cada plataforma, no la misma pieza copiada en todas.

Quienes lo documentan operativamente hoy: Content Allies (agencia B2B que publica sus benchmarks por episodio), Goldcast (repurposing desde webinars) y Distribution.ai de Ross Simmonds.

"This is essentially the GaryVee pillar-to-micro model, but with AI doing what VaynerMedia did with a team of thirty. The architecture is the same: one long recording, dozens of platform-native pieces, and a distribution layer that adapts each one instead of copy-pasting."
Capítulo 2

La aritmética de las 500 piezas

La meta de WON es 500+ piezas al mes a los 90 días. Es realista, pero solo si "pieza" incluye texto e imagen, no solo video. Los números publicados por Content Allies, por grabación:

Tamaño del equipoPiezas por grabación
1 a 2 personas~15
3 a 5 personas30 a 50
Enterprise60 a 100+

Desglose típico de una grabación (30 a 50 piezas)

FormatoCantidadPlataforma natural
Clips verticales8 a 12TikTok, Reels, Shorts
Posts de LinkedIn (texto)5LinkedIn
Emails / newsletter5Email
Piezas de sales enablement5 a 10Interno / ventas
Quote graphics5LinkedIn, IG, X
Carruseles3LinkedIn, IG
Blogs / artículos2 a 3Web, SEO
Audiogramas2LinkedIn, X
La cuenta: 30 a 50 piezas × 10 a 17 grabaciones al mes (2 a 4 por semana) = 500. Alcanzable para una empresa que ya graba todas sus reuniones. Con solo 15 piezas por grabación harían falta 33 grabaciones al mes, poco realista.

Otros números que debes saber

"To hit 500 a month, the math works out to roughly two to four recordings a week at 30 to 50 assets each, counting text and graphics, not just clips. How many recordings does the team generate today?"
Capítulo 3

Cómo calificar un momento de alto valor

Este es el corazón de todo el sistema y donde tus 10 años de ojo visual pesan más. Primero los criterios humanos, luego cómo convertirlos en reglas para una IA.

Los 6 criterios que usan los equipos que lo hacen bien

  1. El test del amigo. Si le mandarías esos 60 segundos a alguien con un "tienes que oír esto", es clip. Si no, no lo es. Es el filtro más rápido y más confiable.
  2. Tipo de momento. Los que rinden: afirmación fuerte o contraintuitiva · dato o estadística sorprendente · opinión polémica · historia emocional · reacción visible del invitado · framework con nombre propio.
  3. Autosuficiencia. El clip se entiende sin contexto previo. Es el filtro que más candidatos de IA elimina: el 80% del fallo es cortar un momento que necesitaba los 40 segundos anteriores ("clip huérfano").
  4. Gancho en 1 a 3 segundos. Si el espectador pasa de largo en 3 segundos, el algoritmo deja de distribuir. El gancho opera en tres capas simultáneas: las palabras, el texto en pantalla, y un cambio visual.
  5. Estructura Hook / Build / Payoff. 0 a 30s gancho, cambio de estímulo cada 30 a 60s, cierre con una idea completa (no a mitad de argumento).
  6. Señal de datos, no de opinión. Usar la analítica de replay de la grabación completa para encontrar los segmentos que la audiencia ya repitió. Este es el input que cierra el bucle de retroalimentación que pide la vacante.

Cómo lo hacen técnicamente las herramientas

Es análisis multiseñal, no una sola cosa:

  1. Transcripción con marcas de tiempo a nivel de palabra.
  2. Ventaneo: se generan candidatos de 30 a 90 segundos deslizando una ventana por la transcripción.
  3. Energía del audio: risas, subidas de volumen, pausas dramáticas, cambios de hablante.
  4. Señales visuales: gestos, cortes de escena, movimiento en pantalla.
  5. LLM como juez: lee cada candidato junto con esas señales y lo puntúa contra criterios explícitos.
  6. Reencuadre a 9:16 con seguimiento de rostro y subtítulos quemados.
El paso 5 es exactamente tu router de n8n: un LLM que clasifica contra un menú cerrado de criterios y devuelve JSON estructurado. Cambia "mensaje de WhatsApp" por "fragmento de transcripción" y es el mismo patrón.

El prompt de scoring (convierte los criterios en reglas)

Esto es lo que entregas en la prueba práctica junto al clip: la demostración de que sabes traducir criterio humano a instrucción de máquina.

Eres un editor senior de contenido para redes sociales. Recibes la
transcripción con marcas de tiempo de una grabación larga. Tu trabajo
es identificar los momentos que funcionan como clips independientes
de 30 a 90 segundos.

Puntúa cada candidato de 0 a 10 en cada criterio:
1. GANCHO: los primeros 3 segundos generan curiosidad o tensión
   sin necesitar contexto.
2. AUTOSUFICIENCIA: el fragmento se entiende completo sin lo que
   vino antes. Si necesita los 40 segundos previos, extiende el
   inicio o descártalo.
3. TIPO: es una afirmación contraintuitiva, un dato sorprendente,
   una opinión polémica, una historia emocional, una reacción
   visible, o un framework con nombre.
4. PAYOFF: cierra con una idea completa, nunca a mitad de frase
   ni a mitad de argumento.
5. TEST DEL AMIGO: se lo mandarías a alguien con "tienes que
   oír esto".

Reglas duras:
- Nunca cortes a mitad de una frase.
- Máximo 15 candidatos por hora de grabación.
- El score final es el promedio ponderado: gancho 30%,
  autosuficiencia 30%, tipo 15%, payoff 15%, test del amigo 10%.

Devuelve SOLO un arreglo JSON, sin texto adicional:
[{"start":"00:12:34.500","end":"00:13:41.200","score":87,
  "tipo":"contraintuitivo","hook_sugerido":"...","titulo":"...",
  "plataformas":["linkedin","shorts","tiktok"],
  "razon":"una frase explicando por qué funciona solo"}]
Fíjate en dos decisiones de diseño: los pesos (autosuficiencia y gancho valen más porque son los que más fallan) y el campo "razon", que te permite auditar por qué el modelo eligió algo y corregir el prompt cuando se equivoca. Sin ese campo, el sistema es una caja negra.
"I'd encode the selection criteria explicitly: hook strength in the first three seconds, whether the clip stands alone without prior context, and a clear payoff. The model scores each candidate against those, returns structured JSON with a reason field, and a human approves in batch. Then performance data feeds back into the weights."
Capítulo 4

El pipeline casero, paso a paso

Esta es tu carta fuerte: no compites editando mejor que un editor, compites construyendo el sistema. Cada paso con su herramienta, su comando y sus pros y contras.

Grabación (Zoom / Meet / Loom / Riverside / Drive)
   │
   ▼
[1] n8n webhook o trigger de carpeta        ← ingesta
   │
   ▼
[2] ffmpeg: extraer audio                    ← 2 segundos
   │
   ▼
[3] Whisper: transcripción + timestamps      ← ver Cap. 5
   │        por palabra (+ diarización)
   ▼
[4] LLM: scoring → JSON de candidatos        ← el prompt del Cap. 3
   │
   ▼
[5] ffmpeg: corte por timestamps             ← 1 seg por clip
   │
   ▼
[6] Reencuadre 9:16                          ← ver Cap. 5 (el paso difícil)
   │
   ▼
[7] Subtítulos ASS quemados                  ← estilo de marca propio
   │
   ▼
[8] LLM: títulos, hooks, captions            ← por plataforma
   │        por plataforma
   ▼
[9] Cola de aprobación humana                ← Sheets / CRM / Notion
   │
   ▼
[10] Publicación multiplataforma             ← ver Cap. 6
   │
   ▼
[11] Métricas → vuelven al prompt de [4]     ← el bucle, ver Cap. 7

Paso 1 · Ingesta

Un webhook en n8n que recibe la URL del archivo, o un trigger que vigila una carpeta de Google Drive. Zoom, Meet y Loom pueden enviar la grabación terminada a una carpeta o a un webhook. Riverside tiene integración directa con Drive.

Paso 2 · Extraer audio

ffmpeg -i grabacion.mp4 -vn -ac 1 -ar 16000 audio.wav

Mono, 16 kHz: es el formato que Whisper espera. Tarda segundos. Ya tienes ffmpeg 6.1 en tu VPS.

Paso 3 · Transcripción

Necesitas timestamps por palabra (para cortar en el lugar exacto) y, si hay varios hablantes, diarización (quién dijo qué). Veredicto: se paga (Deepgram o AssemblyAI, ~USD 5 a 8 al mes por 30 horas). Una sola llamada HTTP desde n8n, respuesta en ~1 minuto por hora de audio. Los números de por qué tu VPS sin GPU no lo resuelve están en el Capítulo 5.

# Deepgram desde n8n (nodo HTTP Request)
POST https://api.deepgram.com/v1/listen
  ?model=nova-3&smart_format=true&diarize=true
  &utterances=true&language=es
Authorization: Token TU_API_KEY
Body: el archivo de audio (binario)

# Devuelve JSON con cada palabra, su inicio, su fin y su hablante

Paso 4 · Scoring con LLM

El prompt del Capítulo 3. La transcripción entra en bloques (una hora de audio son unas 9.000 a 12.000 palabras, cabe en cualquier modelo moderno). Devuelve el JSON de candidatos. Un nodo Set en n8n lo parsea, igual que "Extraer Categoría" en tu workflow de práctica.

Paso 5 · Corte

# Corte rápido sin recodificar (puede desviar unos frames)
ffmpeg -ss 00:12:34.5 -to 00:13:41.2 -i grabacion.mp4 -c copy clip.mp4

# Corte preciso al frame (recodifica, más lento pero exacto)
ffmpeg -ss 00:12:34.5 -to 00:13:41.2 -i grabacion.mp4 \
  -c:v libx264 -preset fast -crf 20 -c:a aac clip.mp4

Paso 6 · Reencuadre a 9:16

Aquí está la diferencia real entre casero y de pago. El recorte centrado fijo es trivial:

ffmpeg -i clip.mp4 -vf "crop=ih*9/16:ih" -c:a copy vertical.mp4

Pero si el hablante se mueve o hay dos personas en pantalla, el recorte fijo los deja fuera. El seguimiento de rostro (que la ventana siga a quien habla) es lo que hacen Vizard y OpusClip y lo que cuesta replicar. Veredicto: se construye con OpenShorts o ClippyMe como base para un hablante o dos apilados (modo SPLIT), que cubre el 80 a 90% de los casos. Solo las mesas de tres o más con interrupciones justifican pagar OpusClip. Detalle y comparativa en el Capítulo 5.

Atajo para grabaciones de Zoom/Meet: muchas ya vienen con el hablante centrado y quieto. Para ese caso el recorte fijo funciona bien y no necesitas seguimiento. Empieza por ahí.

Paso 7 · Subtítulos quemados

Whisper te da cada palabra con su tiempo. Con eso generas un archivo .ass (Advanced SubStation Alpha), un formato que permite animación palabra por palabra (efecto karaoke), colores, fuente y posición: tu estilo de marca, con costo cero.

ffmpeg -i vertical.mp4 -vf "ass=subtitulos.ass" -c:a copy final.mp4

Un script de Python de 40 líneas convierte el JSON de Whisper en .ass. Alternativas de pago: Submagic (el estándar visual, pero ~$0,69 por minuto vía API) o ZapCap (~$0,10 por minuto, la opción programática barata).

Paso 8 · Textos por plataforma

Otra llamada al LLM, con el clip ya elegido: título para Shorts, gancho para TikTok, post de LinkedIn con contexto, tres variantes de caption. Un solo prompt con salida JSON por plataforma.

Paso 9 · Cola de aprobación

Una hoja de Google Sheets o una tabla en tu CRM con: clip, score, razón, textos propuestos, y una columna de estado (pendiente / aprobado / rechazado). Un humano revisa en lote. El sistema no publica nada sin ese "aprobado". Esto es lo que diferencia un motor serio de una fábrica de slop.

Pasos 10 y 11

Publicación (Capítulo 6) y medición con retroalimentación (Capítulo 7).

Pros y contras del pipeline casero

A favorEn contra
Costo marginal cercano a cero por pieza (solo tokens de LLM)El reencuadre con seguimiento de rostro es el paso difícil de replicar bien
Control total del estilo de marca en subtítulos y formatoMantenimiento tuyo: si algo se rompe, nadie más lo arregla
Sin límites de minutos ni de cuentas por planDos piezas se pagan igual (transcripción ~USD 8, publicador ~USD 29): tu VPS sin GPU no transcribe a tiempo y las plataformas exigen auditorías que como persona natural quizá no obtengas
Los criterios de selección son tuyos y auditables (campo "razon")Tiempo de construcción inicial: días, no horas
Se convierte en activo de la empresa, exactamente lo que WON pideSin soporte ni garantías de terceros
Capítulo 5

Construir o pagar, componente por componente

La pregunta correcta no es "todo casero o todo de pago", sino qué componente conviene construir y cuál conviene pagar, y por qué. Aquí el veredicto por pieza.

La idea central: "casero" no significa cero suscripciones. Significa que la inteligencia y el control son tuyos: la rúbrica de selección, la orquestación, la cola de aprobación, el bucle de retroalimentación. Pagas únicamente las dos piezas que son commodity (transcribir y publicar), porque construirlas cuesta más de lo que valen y una de ellas ni siquiera está a tu alcance como persona natural.

El veredicto completo

ComponenteDecisiónPor qué
Ingesta y orquestaciónCONSTRUIRn8n. Ya lo dominas, no hay nada que pagar.
Scoring de momentosCONSTRUIRUn prompt + un LLM barato. Tu rúbrica se afina con datos de views reales; la de Vizard es caja negra y, según reviewers, "directionally useful but inconsistent". La tuya será igual de inconsistente al principio, pero tú la puedes corregir.
Corte y recorte fijoCONSTRUIRffmpeg, gratis, ya instalado en tu VPS.
Reencuadre 1 hablante o 2 apiladosCONSTRUIRCon OpenShorts o ClippyMe como base. Calidad equivalente a Vizard en un hablante estático. Corre en CPU: 5 a 8 min por video de 8 min.
Subtítulos con estilo de marcaCONSTRUIRTimestamps + .ass + ffmpeg. Laborioso una vez, luego gratis para siempre.
Textos por plataformaCONSTRUIROtra llamada al LLM.
Agendar, aprobar, registrar, dashboardCONSTRUIREs lógica de negocio: no cambia cuando las plataformas cambian, y es donde tu jefe va a querer meter mano.
TranscripciónPAGARDeepgram Nova-3 o AssemblyAI, ~USD 5 a 8/mes por 30 horas. Ver detalle abajo: tu VPS sin GPU no lo resuelve bien.
PublicaciónPAGARBlotato USD 29/mes o Zernio ~24. Ver Cap. 6: compras tres auditorías que como persona natural quizá ni puedas obtener.
Reencuadre multi-hablante con interrupcionesPAGAR SOLO ESE 10 A 20%OpusClip es el único que lo hace bien. Vizard también falla ahí ("cropped the wrong face twice"). Solo si WON graba mesas de 3 o más.
Semanas 1 a 4PAGAR TEMPORALMENTEVizard Creator USD 29 vía n8n para producir desde el día uno mientras construyes. Sus 600 créditos cubren el piloto.
La cuenta final: sistema propio ≈ USD 40 a 70/mes (transcripción + publicador + tokens de LLM). Vizard solo, a escala de 500 piezas (~2.100 créditos/mes), necesita un tier Business estimado en USD 80 a 150/mes, y de todas formas tienes que construir la misma orquestación en n8n. OpusClip tiene la API cerrada salvo en Business a cotizar.

Transcripción: por qué pagar (medido, no estimado)

⭐ Benchmark propio, 9 de septiembre de 2026. No es una estimación de un blog: es una medición en el VPS personal de Isaac (Contabo Cloud VPS 6, 6 vCPU compartidas, sin GPU, Ubuntu 24.04), con faster-whisper int8 sobre un briefing de NASA de 29,4 minutos en inglés.
MétricaResultado
Duración del audio29,4 min
Tiempo de transcripción (modelo small)32,3 min
RTF (factor de tiempo real)1,099 → 0,91x: más lento que reproducir el audio
Carga del modelo18 s
Confianza media por palabra91,9%
Salida314 segmentos, 5.421 palabras, marcas al centisegundo

La calidad del texto salió buena. El problema no es la precisión, es el tiempo. Y el dato clave: la literatura estimaba small en RTF 0,25 a 0,42 en un i7 de escritorio. En vCPU compartidas de nube el resultado real fue 3 a 4 veces peor. Esa brecha entre el benchmark publicado y el hardware real es justamente lo que hay que medir antes de decidir una arquitectura.

Modelo en este VPSRTFCPU necesaria para 30 h de audio/mes¿Viable?
small (medido)1,1~33 hApretado, y calidad solo "small"
medium (extrapolado ~2,5x)~2,7~80 hNo
large-v3 (extrapolado ~5x)~5,5~165 hImposible
Diarización en CPU~5+150 hImpráctico

Sumado a que sin diarización no sabes quién dijo qué en una reunión de tres personas, y a que esas horas compiten con n8n, Redis y Postgres por los mismos 6 núcleos, la decisión se cae sola.

APIUSD por hora de audio30 h/mesTimestamps por palabraDiarización
Groq whisper-large-v3-turbo0,041,20No
AssemblyAI Universal-20,175,10
Deepgram Nova-3 batch0,267,80
OpenAI whisper-10,3610,80No
GPU alquilada (RunPod) + WhisperX0,02 a 0,051 a 2Sí (los mejores)
Recomendación: Deepgram o AssemblyAI como motor principal (una sola llamada HTTP desde n8n, respuesta en ~1 minuto por hora de audio, con quién habla incluido). Groq turbo a 4 centavos si una pieza no necesita diarización. El contenedor whisper:9000 que ya tienes sigue siendo correcto para notas de voz cortas. Si el volumen creciera 5x (150 h/mes), Deepgram sube a ~USD 39/mes: sigue siendo menos que una hora de tu tiempo. El punto de quiebre para GPU propia está por encima de 500 h/mes, o cuando haya requisitos de privacidad que prohíban sacar el audio.
"I benchmarked Whisper on my own server before deciding: six vCPUs, no GPU. The small model came in at a real-time factor of 1.1, meaning transcription took longer than the recording itself, and that's the fastest usable model. Published benchmarks had suggested three to four times better, but those were on desktop hardware. Scaling to thirty hours a month with a production-quality model would need around a hundred and sixty CPU hours, and it still wouldn't give me speaker diarization. Deepgram does it for under ten dollars a month. That's not a preference, it's a measurement."

Vizard: qué hace por dentro y cuándo tiene sentido

Vizard no publica su arquitectura, pero su pipeline coincide con el de todos los clones abiertos y con los parámetros de su propia API:

PiezaDificultad de replicar
Transcripción con timestampsTrivial (o se paga, ver arriba)
Selección de momentos + "viral score"Fácil de replicar, difícil de validar. Nadie tiene datos de que el score prediga views.
Corte limpio y quitar silenciosTrivial. Vizard también corta "un segundo antes o después".
Reencuadre 16:9 → 9:16 con seguimientoLa pieza difícil. Un hablante: fácil. Dos o más con interrupciones: donde Vizard mismo falla.
Subtítulos estilizadosFácil pero laborioso.

¿Es el estándar en agencias grandes? No hay evidencia de que "los equipos serios construyen lo suyo". Lo que existe es: SaaS (OpusClip, Vizard) para quien tiene volumen y no tiene equipo técnico, y clones abiertos maduros (OpenShorts, ~4.000 estrellas, MIT, con servidor MCP y API; ClippyMe; auto-vertical-reframe) para quien sí lo tiene. OpusClip afirma "docenas de Fortune 500" pero su API solo está en Business a cotizar.

Límites reales de Vizard: 1 crédito = 1 minuto subido (no exportado). Creator USD 29/mes con 600 créditos y 3 peticiones por minuto. A 500 piezas al mes (~35 episodios de 60 min) necesitas ~2.100 créditos: Creator no alcanza, hace falta Business con tier de ~2.400/mes, estimado en USD 80 a 150. Pre-recortar silencios y el pre-show ahorra ~30% de créditos.

Regla de decisión: Vizard es lo correcto cuando el cuello de botella es tiempo humano y no hay desarrollador. Con tu perfil, el pipeline propio cuesta 3 a 5 semanas de trabajo y ~USD 10 a 20/mes de LLM. La única compra defendible a largo plazo es OpusClip para mesas multi-cámara, y solo si WON las graba.

Reencuadre automático: las opciones abiertas

ProyectoStackEn CPU sin GPU
OpenShortsfaster-whisper + Gemini u Ollama + MediaPipe/YOLOv8. Modos TRACK, SPLIT, SCREENCAST5 a 8 min por video de 8 min. 8 GB RAM mínimo. Tiene MCP y API.
ClippyMeYOLOv8 + FaceMesh (detecta quién habla por apertura de boca) + suavizado + detección de escenasDocker CPU soportado.
auto-vertical-reframeYOLOv11-seg + ByteTrack + PySceneDetectBeta.
pyautoflipSaliencia (sucesor del AutoFlip de Google)Ligero.
Truco práctico: el modo SPLIT (dos caras apiladas verticalmente) evita por completo el problema del seguimiento en podcasts de dos personas. Y las grabaciones de Zoom/Meet suelen traer al hablante centrado y quieto, donde el recorte fijo funciona bien. Empieza por ahí; el seguimiento de rostro es para el 10 a 20% de casos difíciles.

Estimación para tu VPS: un episodio de 60 min → 15 clips de 45 s ≈ 40 a 60 min de proceso. 500 piezas al mes ≈ 30 horas de CPU mensuales, en cola nocturna. Cabe.

Capítulo 6

Publicación multiplataforma: el laberinto de APIs

Publicar es la parte que más sorprende a quien no la ha peleado. El código es fácil. Lo difícil es que cada plataforma exige aprobación previa para dejarte publicar por API.

PlataformaRealidad de su API (confirmado)
YouTube Shorts✅ API oficial abierta, la más fácil. Cuota diaria por unidades.
TikTok⚠️ Content Posting API con Direct Post, pero exige auditoría adicional de 5 a 10 días hábiles. Sin auditar, todo lo publicado queda en modo SELF_ONLY (privado). Es el mayor riesgo de cronograma.
Instagram⚠️ Graph API solo para cuentas Business/Creator ligadas a una página de Facebook. Límite de 100 posts por API cada 24 h. Reels máximo 90 segundos por API (la app permite 3 min).
LinkedIn⚠️ Publicar como organización requiere Community Management API con solicitud formal, video demo y credenciales de prueba. La Posts API no tiene parámetro de agendamiento: el horario vive en tu sistema.
X⚠️ API de pago por niveles, con límites de escritura ajustados.

Las tres opciones de pago (confirmado)

HerramientaAPIDato clave
BlotatoREST + servidor MCP + nodo oficial de n8nPublica en 9 plataformas (IG, YouTube, TikTok, FB, LinkedIn, Threads, X, Pinterest, Bluesky). Resuelve por ti las auditorías y tokens. Hay plantillas listas en n8n.
BufferAPI en todos los planes, incluido el gratuitoSólido y barato para empezar.
MetricoolAPI solo desde plan Advanced (~USD 67/mes)Fuerte en analítica, más caro para la API.

Qué vende Blotato realmente

No vende "llamar APIs". Vende una aplicación ya aprobada por cada plataforma. Sus propios textos lo dicen: la aprobación de Instagram se hizo una vez, a nivel de la app de Blotato, y los refresh de tokens OAuth los manejan ellos. Tú conectas tu cuenta con un clic y heredas su App Review de Meta, su auditoría de TikTok, su tier de LinkedIn y su cuota de YouTube.

PlanUSD/mesCuentasDato clave
Starter29 (24 anual)20API incluida. Topes propios: 50 IG/24h, 25 FB, 50 LinkedIn. Para 500 piezas al mes (~17/día) sobra.
Creator9740Sin tope declarado.
Agency499IlimitadasPara operar clientes.

Servidor MCP en mcp.blotato.com/mcp con 35 herramientas. Agenda con scheduledTime o useNextFreeSlot. Publicar no consume créditos (solo la parte de IA). Alternativa más barata: Zernio (~USD 24/mes, REST + webhooks + analytics).

La burocracia real de construirlo en casa

Esto es lo que te ahorras al pagar USD 29:

PlataformaQué exigePlazoSi no aprueban
TikTokAuditoría con video demo del flujo completo, política de privacidad, web con la misma marca, y una UX obligatoria (mostrar avatar del creador, selector de privacidad, toggles de duet/stitch, declaración comercial)2 a 4 semanas con varias rondasTodo se publica en privado para siempre y máximo 5 usuarios/día. Postiz (open source) fue rechazado en abril de 2026 y sigue sin resolver.
Meta (IG + Threads)Verificación de empresa con documentos legales, screencast desde el login, entorno de prueba para el revisorMeta subió su guía de 10 a 20 días en 2026Rechazos por "papeleo y screencast flojo", no por técnica. Reenvías y vuelves a la cola.
LinkedInEntidad legal registrada, página verificada, email corporativo, screencast por caso de uso1 a 4 semanas; LinkedIn "contacta hasta 60 días después solo si hay encaje"Sin recurso. Persona natural sin empresa: no aplica. Y el token expira a 60 días sin refresh salvo que seas partner.
YouTubeProyecto + OAuth verificadoSacar la app de "Testing" (si no, los tokens duran 7 días)Cuota por defecto: 100 subidas/día. Para 500 al mes no necesitas extensión. La más fácil.
XCuenta de desarrollador, pago por usoInmediatoUSD 0,015 por post, 0,20 si lleva link. Evitar links en el post.
Esfuerzo honesto de construirlo: para alguien que ya peleó con Meta y TikTok, 4 a 6 semanas de trabajo real para 6 plataformas (OAuth, refresh, subida en fragmentos, cola, reintentos), sin contar 1 a 2 meses de calendario esperando aprobaciones. Después, 1 a 2 días al mes de mantenimiento cuando las plataformas cambian algo (LinkedIn versiona trimestralmente). USD 29/mes es menos que una hora de tu tiempo.

¿Devuelven métricas para cerrar el bucle?

Veredicto de publicación

ComponenteDecisiónPor qué
PublicarPAGAR Blotato 29 o Zernio 24Compras tres auditorías. Sin la de TikTok, todo queda privado. LinkedIn exige empresa.
Agendar y cadenciaCONSTRUIRFranjas, reglas por plataforma, cadencia escalonada. El proveedor solo recibe la hora.
Cola de aprobaciónCONSTRUIRNinguna API la resuelve bien y es donde el jefe querrá meter mano.
MedirHÍBRIDOAnalytics de Blotato para 5 plataformas; LinkedIn a mano o vía Metricool si el volumen lo justifica.

Cuándo construirlo sí sería correcto: si vas a operar más de 50 cuentas de clientes, o si el puesto exige propiedad total de datos y ya eres empresa registrada con 2 meses de margen. Para 500 piezas de una marca: paga el publicador, construye todo lo demás, y deja el conector abstraído para reemplazarlo si un día se justifica.

"For publishing I'd use a connector like Blotato rather than build the integrations. It's not the code, it's the approvals: TikTok's audit takes weeks and without it everything posts as private, and LinkedIn's API requires a registered company. Twenty-nine dollars a month buys three approvals. What I'd build is everything around it: the scheduling logic, the approval queue, the log of what went where, and the analytics loop."
Lo que sí sabes ya por experiencia propia: tú ya publicas en Meta y TikTok desde tu dashboard (dash.one4tools.com) y tienes el sistema de publicación en Instagram. Sabes lo que cuesta pelear con esas APIs. Ese conocimiento vale en la entrevista: puedes hablar del tema desde la práctica, no desde la documentación.
Capítulo 7

Medir y cerrar el bucle: donde tú ganas

Esta es la parte que la mayoría de candidatos va a tratar como secundaria y que para WON es central: "Performance analysis that feeds directly back into future clip selection" y "Dashboards that monitor production velocity, quality, turnaround time, and business impact".

Las dos familias de métricas

Métricas de producción (el motor)Métricas de audiencia (el resultado)
Grabaciones ingresadas por semanaVistas y alcance por pieza y por plataforma
Piezas generadas por grabaciónRetención (% que ve hasta el final)
Tasa de aprobación (aprobadas / generadas)Engagement (likes, comentarios, compartidos, guardados)
Tiempo de ciclo: grabación → publicadoClics y conversiones si hay CTA
Costo por pieza (tokens + herramientas)Crecimiento de seguidores atribuible
Piezas publicadas por semana (la meta de 500)Qué tipos de momento rinden más

El bucle de retroalimentación, concretamente

  1. Cada clip publicado se registra con su score, su tipo y su razon (del JSON del scorer).
  2. A los 7 días se recogen sus métricas de audiencia.
  3. Un análisis cruza: ¿los clips de tipo "contraintuitivo" rinden más que los de tipo "historia"? ¿Los de score 90+ realmente superan a los de 75?
  4. Con eso se ajustan los pesos del prompt del Capítulo 3, y se agregan ejemplos de clips ganadores como referencia (few-shot).
  5. El sistema del mes siguiente elige mejor que el del mes anterior.
Esto es idéntico a lo que ya construiste: tu pipeline de anuncios donde los ganadores alimentan los prompts del siguiente lote, y tu análisis de CPA por marca que conecta inversión con ventas reales. Es la misma lógica aplicada a contenido. Cuéntalo así.

El dashboard

Tu CRM de reportes ejecutivos es la prueba de que sabes construir esto. Para WON sería un panel con las dos familias de métricas, actualizado desde las APIs (no a mano), con las mismas capas que ya usas: cierre semanal, embudo de producción (ingresado → generado → aprobado → publicado), y costo por pieza.

"The measurement layer is where the system stops being a factory and starts learning. Every clip carries its score and its reason. Seven days after publishing, real performance comes back, and that adjusts the selection weights. I've built exactly this loop for paid media: winning ads feed the next batch of prompts. Same logic, different asset."
Capítulo 8

Los errores al escalar (y cómo los evitan los buenos)

ErrorQué pasaCómo se evita
AI slopEn 2025 el 52% de los artículos nuevos ya eran generados por IA. El daño no es de exactitud sino de credibilidad: la audiencia descuenta todo.Aprobación humana obligatoria. Menos piezas mejores antes que más piezas genéricas.
Confundir volumen con velocidadEl cuello de botella real no es generar, es aprobar. Sin QC humano al final, el sistema publica clips sin contexto.Diseñar la cola de aprobación como parte central, no como añadido. Aprobar en lote.
Clips huérfanosEl 80% del fallo: cortar un momento que necesitaba los 40 segundos previos.El criterio de autosuficiencia con peso alto en el scoring.
Saturar un canalPublicar todo el mismo día en la misma red quema a la audiencia.Cadencia escalonada: episodio lunes, clips martes, blog miércoles, gráficos jueves, newsletter viernes.
No cerrar el bucle500 piezas sin retroalimentación de desempeño es una fábrica ciega.El Capítulo 7.
Ignorar el riesgo legalClips de llamadas de venta y reuniones internas sin consentimiento.El Capítulo 11.
Capítulo 9

MCP explicado a fondo

Te lo van a preguntar o lo vas a poder usar como argumento. Y tienes exposición real aunque no lo hayas nombrado así.

Qué es

Model Context Protocol: un protocolo abierto, publicado por Anthropic a fines de 2024, para conectar modelos de IA con herramientas y datos externos de forma estándar. La analogía que más se usa: es el USB-C de la IA. Antes, cada integración entre un modelo y un sistema (tu CRM, tu base de datos, Slack) se construía a medida. Con MCP, escribes un "servidor" una vez y cualquier "cliente" compatible lo puede usar.

Cómo funciona

CLIENTE MCP                         SERVIDOR MCP
(Claude Code, ChatGPT,   ←──────→   (expone capacidades)
 Cursor, n8n, Antigravity)
                                    Un servidor ofrece 3 cosas:
                                    • TOOLS: acciones que el modelo
                                      puede ejecutar (crear un
                                      workflow, publicar un post)
                                    • RESOURCES: datos que puede leer
                                      (archivos, registros, docs)
                                    • PROMPTS: plantillas reutilizables

El modelo no "sabe" cómo hablar con n8n o con Blotato. El servidor MCP traduce: le describe al modelo qué herramientas existen y qué parámetros necesitan, y ejecuta la acción cuando el modelo la pide.

Tu exposición real

En tu entorno de Claude Code tienes configurado n8n-mcp: un servidor MCP conectado a tu instancia de n8n. Cuando yo creo o edito tus workflows desde esta conversación, lo hago a través de ese servidor. También tienes servidores de Stitch y otros. Eso es usar MCP en producción, aunque no lo hayas llamado así. Estás dentro del 41% de organizaciones que ya lo tienen operando.

Estado en 2026

Por qué importa para el motor de contenido

Varias piezas del pipeline ya tienen servidor MCP: Blotato (publicar), Reap (clipear), openshorts (pipeline abierto). Eso significa que un agente puede, con lenguaje natural, decir "publica este clip en LinkedIn y TikTok mañana a las 9" y el servidor MCP lo ejecuta. Es la capa que convierte tus workflows en algo que un agente puede operar.

"I already use MCP in production: my n8n instance is connected to Claude Code through an MCP server, which is how I build and edit workflows conversationally. For the content engine, the interesting part is that the publishing and clipping layers already expose MCP servers, so an agent can drive the pipeline end to end without custom glue code for each tool."
Capítulo 10

Modelos, costos y cómo elegir

Panorama a septiembre de 2026

ModeloUSD por millón (entrada / salida)Fuerte en
Claude Fable 5.1$10 / $50Punta del ranking general. Razonamiento cuidadoso, escritura.
GPT-6 Astra (3-sep-2026)$10 / $50Uso de computador y navegador, ingeniería de software.
Claude Opus 5$5 / $25Trabajo agéntico complejo, contexto 1M.
Claude Sonnet 5$2 / $10Equilibrio general.
Gemini 3.8 Flash (2-sep-2026)$0,75 / $3,75Multimodal real: texto, imagen, audio, PDF y video. Contexto 1M. ⚠️ Precio se duplica el 1-ene-2027.
Claude Haiku 4.5$1 / $5Volumen, clasificación.

Astra: qué es y qué te cambia

Corrección importante: "Astra" hoy es GPT-6 Astra de OpenAI, lanzado el 3 de septiembre de 2026. El Project Astra de Google es otra cosa (un prototipo de investigación sin lanzamiento). No los confundas en la entrevista.

Lo importante de Astra no es que escriba mejor: es que opera computador y navegador como una persona. Eso toca directamente el pipeline: CapCut, Canva y OpusClip no tienen API y por eso no se automatizan. Un modelo que maneja el navegador puede operarlas sin API.

La lectura práctica: n8n sigue ganando en procesos determinísticos, repetibles y baratos. Astra gana en lo que hoy se hace a mano porque no hay API. No se reemplazan, se reparten el trabajo.

Dos advertencias: cuesta $10/$50 (caro para volumen), y usa una técnica que oscurece su cadena de razonamiento, mala para procesos que necesitan auditoría.

Gemini 3.8 Flash: el que cambia el scoring

Es multimodal con video a un precio de modelo pequeño. Para puntuar momentos no estás obligado a pasar solo por la transcripción: un modelo barato puede ver el video (gestos, expresiones, energía visual). Eso es "scoring multimodal, no solo transcripción", y es un argumento fuerte.

Routing por niveles: el patrón estándar de costos

TráficoNivelPara qué en el motor
~70%Barato (Gemini 3.8 Flash, Haiku 4.5)Scoring de candidatos, clasificación por tipo, captions
~20%Medio (Sonnet 5)Posts de LinkedIn con contexto, textos largos
~10%Frontera (Fable 5.1, Opus 5)Análisis mensual del bucle, decisiones de estrategia

Reportes de la industria citan reducciones de costo cercanas al 85% con este patrón, más caché de prompt (Anthropic: 0,1x en aciertos) y Batch API al 50%. Conecta directo con lo que hiciste al bajar tu prompt de 57k a 26k tokens.

Cómo se mide la latencia

No se memoriza, se mide: un timestamp antes de la llamada, otro después, se resta, se promedian 20 o 30 ejecuciones reales. En n8n, dos nodos Code alrededor de la llamada HTTP. Distingue tiempo al primer token (crítico en voz y chat en vivo) de tiempo total (lo que importa en un pipeline por lotes como este).

Tu stack actual está vigente

Flujos que se volvieron estándar: desarrollo guiado por especificación (spec-driven), agentes en paralelo con git worktrees, y el patrón Coordinador → Implementadores → Verificador (un agente aparte que revisa lo que hicieron los otros, lo más subutilizado según la literatura).

Referencia

Glosario

TérminoQué es
Pilar / micro-piezaLa grabación larga original / cada pieza corta derivada de ella.
RepurposingReutilizar un contenido en múltiples formatos y plataformas.
HookLos primeros 1 a 3 segundos que deciden si el espectador se queda.
PayoffEl cierre del clip: la idea completa que justifica haberlo visto.
Clip huérfanoFragmento cortado que no se entiende sin lo que vino antes.
DiarizaciónIdentificar quién habla en cada momento de una grabación.
Timestamps por palabraEl tiempo exacto de inicio y fin de cada palabra transcrita. Necesario para cortar y subtitular con precisión.
Reencuadre / smart cropConvertir video horizontal 16:9 en vertical 9:16 siguiendo al hablante.
.assFormato de subtítulos que permite animación, color y posición (efecto karaoke).
Quemar subtítulosIncrustarlos en la imagen del video (no como pista aparte). Necesario para redes.
LLM como juezUsar un modelo para puntuar candidatos contra criterios explícitos.
Few-shotIncluir ejemplos de referencia en el prompt para que el modelo aprenda el criterio.
Routing por nivelesEnviar cada tarea al modelo más barato que la resuelva bien.
MCPModel Context Protocol: estándar para conectar modelos con herramientas y datos.
Direct Post (TikTok)Publicar directo por API. Exige auditoría; sin ella, todo queda privado.
Graph API (Meta)La API de Instagram y Facebook. Solo cuentas Business/Creator.
Community Management API (LinkedIn)La API para publicar como empresa. Requiere solicitud formal.
Tiempo de cicloDesde que entra la grabación hasta que la pieza está publicada.
Tasa de aprobaciónPiezas aprobadas / piezas generadas. Mide la calidad del scorer.
SlopContenido generado por IA sin criterio ni revisión. Destruye credibilidad.