Material de estudio para el rol de Founding AI Content Operations Lead · Isaac Hernández
Lo que WON quiere construir tiene tres nombres que conviven en la industria: content repurposing at scale, content OS (o content engine) y founder-led content operations. La arquitectura es siempre la misma pirámide invertida: una grabación larga se disecciona en decenas de piezas adaptadas a cada plataforma.
El antecedente público más citado es el modelo de VaynerMedia (2018). Una pieza pilar (keynote, podcast, reunión) produce 30 o más piezas distribuidas en 6 a 10 plataformas. Un solo keynote de Gary Vaynerchuk generó más de 30 piezas y 35 millones de vistas. Es exactamente lo que pide WON, con la diferencia de que ellos quieren hacerlo con IA en vez de con un equipo grande.
Quienes lo documentan operativamente hoy: Content Allies (agencia B2B que publica sus benchmarks por episodio), Goldcast (repurposing desde webinars) y Distribution.ai de Ross Simmonds.
La meta de WON es 500+ piezas al mes a los 90 días. Es realista, pero solo si "pieza" incluye texto e imagen, no solo video. Los números publicados por Content Allies, por grabación:
| Tamaño del equipo | Piezas por grabación |
|---|---|
| 1 a 2 personas | ~15 |
| 3 a 5 personas | 30 a 50 |
| Enterprise | 60 a 100+ |
| Formato | Cantidad | Plataforma natural |
|---|---|---|
| Clips verticales | 8 a 12 | TikTok, Reels, Shorts |
| Posts de LinkedIn (texto) | 5 | |
| Emails / newsletter | 5 | |
| Piezas de sales enablement | 5 a 10 | Interno / ventas |
| Quote graphics | 5 | LinkedIn, IG, X |
| Carruseles | 3 | LinkedIn, IG |
| Blogs / artículos | 2 a 3 | Web, SEO |
| Audiogramas | 2 | LinkedIn, X |
Este es el corazón de todo el sistema y donde tus 10 años de ojo visual pesan más. Primero los criterios humanos, luego cómo convertirlos en reglas para una IA.
Es análisis multiseñal, no una sola cosa:
Esto es lo que entregas en la prueba práctica junto al clip: la demostración de que sabes traducir criterio humano a instrucción de máquina.
Eres un editor senior de contenido para redes sociales. Recibes la
transcripción con marcas de tiempo de una grabación larga. Tu trabajo
es identificar los momentos que funcionan como clips independientes
de 30 a 90 segundos.
Puntúa cada candidato de 0 a 10 en cada criterio:
1. GANCHO: los primeros 3 segundos generan curiosidad o tensión
sin necesitar contexto.
2. AUTOSUFICIENCIA: el fragmento se entiende completo sin lo que
vino antes. Si necesita los 40 segundos previos, extiende el
inicio o descártalo.
3. TIPO: es una afirmación contraintuitiva, un dato sorprendente,
una opinión polémica, una historia emocional, una reacción
visible, o un framework con nombre.
4. PAYOFF: cierra con una idea completa, nunca a mitad de frase
ni a mitad de argumento.
5. TEST DEL AMIGO: se lo mandarías a alguien con "tienes que
oír esto".
Reglas duras:
- Nunca cortes a mitad de una frase.
- Máximo 15 candidatos por hora de grabación.
- El score final es el promedio ponderado: gancho 30%,
autosuficiencia 30%, tipo 15%, payoff 15%, test del amigo 10%.
Devuelve SOLO un arreglo JSON, sin texto adicional:
[{"start":"00:12:34.500","end":"00:13:41.200","score":87,
"tipo":"contraintuitivo","hook_sugerido":"...","titulo":"...",
"plataformas":["linkedin","shorts","tiktok"],
"razon":"una frase explicando por qué funciona solo"}]
Esta es tu carta fuerte: no compites editando mejor que un editor, compites construyendo el sistema. Cada paso con su herramienta, su comando y sus pros y contras.
Grabación (Zoom / Meet / Loom / Riverside / Drive) │ ▼ [1] n8n webhook o trigger de carpeta ← ingesta │ ▼ [2] ffmpeg: extraer audio ← 2 segundos │ ▼ [3] Whisper: transcripción + timestamps ← ver Cap. 5 │ por palabra (+ diarización) ▼ [4] LLM: scoring → JSON de candidatos ← el prompt del Cap. 3 │ ▼ [5] ffmpeg: corte por timestamps ← 1 seg por clip │ ▼ [6] Reencuadre 9:16 ← ver Cap. 5 (el paso difícil) │ ▼ [7] Subtítulos ASS quemados ← estilo de marca propio │ ▼ [8] LLM: títulos, hooks, captions ← por plataforma │ por plataforma ▼ [9] Cola de aprobación humana ← Sheets / CRM / Notion │ ▼ [10] Publicación multiplataforma ← ver Cap. 6 │ ▼ [11] Métricas → vuelven al prompt de [4] ← el bucle, ver Cap. 7
Un webhook en n8n que recibe la URL del archivo, o un trigger que vigila una carpeta de Google Drive. Zoom, Meet y Loom pueden enviar la grabación terminada a una carpeta o a un webhook. Riverside tiene integración directa con Drive.
ffmpeg -i grabacion.mp4 -vn -ac 1 -ar 16000 audio.wav
Mono, 16 kHz: es el formato que Whisper espera. Tarda segundos. Ya tienes ffmpeg 6.1 en tu VPS.
Necesitas timestamps por palabra (para cortar en el lugar exacto) y, si hay varios hablantes, diarización (quién dijo qué). Veredicto: se paga (Deepgram o AssemblyAI, ~USD 5 a 8 al mes por 30 horas). Una sola llamada HTTP desde n8n, respuesta en ~1 minuto por hora de audio. Los números de por qué tu VPS sin GPU no lo resuelve están en el Capítulo 5.
# Deepgram desde n8n (nodo HTTP Request) POST https://api.deepgram.com/v1/listen ?model=nova-3&smart_format=true&diarize=true &utterances=true&language=es Authorization: Token TU_API_KEY Body: el archivo de audio (binario) # Devuelve JSON con cada palabra, su inicio, su fin y su hablante
El prompt del Capítulo 3. La transcripción entra en bloques (una hora de audio son unas 9.000 a 12.000 palabras, cabe en cualquier modelo moderno). Devuelve el JSON de candidatos. Un nodo Set en n8n lo parsea, igual que "Extraer Categoría" en tu workflow de práctica.
# Corte rápido sin recodificar (puede desviar unos frames) ffmpeg -ss 00:12:34.5 -to 00:13:41.2 -i grabacion.mp4 -c copy clip.mp4 # Corte preciso al frame (recodifica, más lento pero exacto) ffmpeg -ss 00:12:34.5 -to 00:13:41.2 -i grabacion.mp4 \ -c:v libx264 -preset fast -crf 20 -c:a aac clip.mp4
Aquí está la diferencia real entre casero y de pago. El recorte centrado fijo es trivial:
ffmpeg -i clip.mp4 -vf "crop=ih*9/16:ih" -c:a copy vertical.mp4
Pero si el hablante se mueve o hay dos personas en pantalla, el recorte fijo los deja fuera. El seguimiento de rostro (que la ventana siga a quien habla) es lo que hacen Vizard y OpusClip y lo que cuesta replicar. Veredicto: se construye con OpenShorts o ClippyMe como base para un hablante o dos apilados (modo SPLIT), que cubre el 80 a 90% de los casos. Solo las mesas de tres o más con interrupciones justifican pagar OpusClip. Detalle y comparativa en el Capítulo 5.
Whisper te da cada palabra con su tiempo. Con eso generas un archivo .ass (Advanced SubStation Alpha), un formato que permite animación palabra por palabra (efecto karaoke), colores, fuente y posición: tu estilo de marca, con costo cero.
ffmpeg -i vertical.mp4 -vf "ass=subtitulos.ass" -c:a copy final.mp4
Un script de Python de 40 líneas convierte el JSON de Whisper en .ass. Alternativas de pago: Submagic (el estándar visual, pero ~$0,69 por minuto vía API) o ZapCap (~$0,10 por minuto, la opción programática barata).
Otra llamada al LLM, con el clip ya elegido: título para Shorts, gancho para TikTok, post de LinkedIn con contexto, tres variantes de caption. Un solo prompt con salida JSON por plataforma.
Una hoja de Google Sheets o una tabla en tu CRM con: clip, score, razón, textos propuestos, y una columna de estado (pendiente / aprobado / rechazado). Un humano revisa en lote. El sistema no publica nada sin ese "aprobado". Esto es lo que diferencia un motor serio de una fábrica de slop.
Publicación (Capítulo 6) y medición con retroalimentación (Capítulo 7).
| A favor | En contra |
|---|---|
| Costo marginal cercano a cero por pieza (solo tokens de LLM) | El reencuadre con seguimiento de rostro es el paso difícil de replicar bien |
| Control total del estilo de marca en subtítulos y formato | Mantenimiento tuyo: si algo se rompe, nadie más lo arregla |
| Sin límites de minutos ni de cuentas por plan | Dos piezas se pagan igual (transcripción ~USD 8, publicador ~USD 29): tu VPS sin GPU no transcribe a tiempo y las plataformas exigen auditorías que como persona natural quizá no obtengas |
| Los criterios de selección son tuyos y auditables (campo "razon") | Tiempo de construcción inicial: días, no horas |
| Se convierte en activo de la empresa, exactamente lo que WON pide | Sin soporte ni garantías de terceros |
La pregunta correcta no es "todo casero o todo de pago", sino qué componente conviene construir y cuál conviene pagar, y por qué. Aquí el veredicto por pieza.
| Componente | Decisión | Por qué |
|---|---|---|
| Ingesta y orquestación | CONSTRUIR | n8n. Ya lo dominas, no hay nada que pagar. |
| Scoring de momentos | CONSTRUIR | Un prompt + un LLM barato. Tu rúbrica se afina con datos de views reales; la de Vizard es caja negra y, según reviewers, "directionally useful but inconsistent". La tuya será igual de inconsistente al principio, pero tú la puedes corregir. |
| Corte y recorte fijo | CONSTRUIR | ffmpeg, gratis, ya instalado en tu VPS. |
| Reencuadre 1 hablante o 2 apilados | CONSTRUIR | Con OpenShorts o ClippyMe como base. Calidad equivalente a Vizard en un hablante estático. Corre en CPU: 5 a 8 min por video de 8 min. |
| Subtítulos con estilo de marca | CONSTRUIR | Timestamps + .ass + ffmpeg. Laborioso una vez, luego gratis para siempre. |
| Textos por plataforma | CONSTRUIR | Otra llamada al LLM. |
| Agendar, aprobar, registrar, dashboard | CONSTRUIR | Es lógica de negocio: no cambia cuando las plataformas cambian, y es donde tu jefe va a querer meter mano. |
| Transcripción | PAGAR | Deepgram Nova-3 o AssemblyAI, ~USD 5 a 8/mes por 30 horas. Ver detalle abajo: tu VPS sin GPU no lo resuelve bien. |
| Publicación | PAGAR | Blotato USD 29/mes o Zernio ~24. Ver Cap. 6: compras tres auditorías que como persona natural quizá ni puedas obtener. |
| Reencuadre multi-hablante con interrupciones | PAGAR SOLO ESE 10 A 20% | OpusClip es el único que lo hace bien. Vizard también falla ahí ("cropped the wrong face twice"). Solo si WON graba mesas de 3 o más. |
| Semanas 1 a 4 | PAGAR TEMPORALMENTE | Vizard Creator USD 29 vía n8n para producir desde el día uno mientras construyes. Sus 600 créditos cubren el piloto. |
| Métrica | Resultado |
|---|---|
| Duración del audio | 29,4 min |
| Tiempo de transcripción (modelo small) | 32,3 min |
| RTF (factor de tiempo real) | 1,099 → 0,91x: más lento que reproducir el audio |
| Carga del modelo | 18 s |
| Confianza media por palabra | 91,9% |
| Salida | 314 segmentos, 5.421 palabras, marcas al centisegundo |
La calidad del texto salió buena. El problema no es la precisión, es el tiempo. Y el dato clave: la literatura estimaba small en RTF 0,25 a 0,42 en un i7 de escritorio. En vCPU compartidas de nube el resultado real fue 3 a 4 veces peor. Esa brecha entre el benchmark publicado y el hardware real es justamente lo que hay que medir antes de decidir una arquitectura.
| Modelo en este VPS | RTF | CPU necesaria para 30 h de audio/mes | ¿Viable? |
|---|---|---|---|
| small (medido) | 1,1 | ~33 h | Apretado, y calidad solo "small" |
| medium (extrapolado ~2,5x) | ~2,7 | ~80 h | No |
| large-v3 (extrapolado ~5x) | ~5,5 | ~165 h | Imposible |
| Diarización en CPU | ~5 | +150 h | Impráctico |
Sumado a que sin diarización no sabes quién dijo qué en una reunión de tres personas, y a que esas horas compiten con n8n, Redis y Postgres por los mismos 6 núcleos, la decisión se cae sola.
| API | USD por hora de audio | 30 h/mes | Timestamps por palabra | Diarización |
|---|---|---|---|---|
| Groq whisper-large-v3-turbo | 0,04 | 1,20 | Sí | No |
| AssemblyAI Universal-2 | 0,17 | 5,10 | Sí | Sí |
| Deepgram Nova-3 batch | 0,26 | 7,80 | Sí | Sí |
| OpenAI whisper-1 | 0,36 | 10,80 | Sí | No |
| GPU alquilada (RunPod) + WhisperX | 0,02 a 0,05 | 1 a 2 | Sí (los mejores) | Sí |
Vizard no publica su arquitectura, pero su pipeline coincide con el de todos los clones abiertos y con los parámetros de su propia API:
| Pieza | Dificultad de replicar |
|---|---|
| Transcripción con timestamps | Trivial (o se paga, ver arriba) |
| Selección de momentos + "viral score" | Fácil de replicar, difícil de validar. Nadie tiene datos de que el score prediga views. |
| Corte limpio y quitar silencios | Trivial. Vizard también corta "un segundo antes o después". |
| Reencuadre 16:9 → 9:16 con seguimiento | La pieza difícil. Un hablante: fácil. Dos o más con interrupciones: donde Vizard mismo falla. |
| Subtítulos estilizados | Fácil pero laborioso. |
¿Es el estándar en agencias grandes? No hay evidencia de que "los equipos serios construyen lo suyo". Lo que existe es: SaaS (OpusClip, Vizard) para quien tiene volumen y no tiene equipo técnico, y clones abiertos maduros (OpenShorts, ~4.000 estrellas, MIT, con servidor MCP y API; ClippyMe; auto-vertical-reframe) para quien sí lo tiene. OpusClip afirma "docenas de Fortune 500" pero su API solo está en Business a cotizar.
Límites reales de Vizard: 1 crédito = 1 minuto subido (no exportado). Creator USD 29/mes con 600 créditos y 3 peticiones por minuto. A 500 piezas al mes (~35 episodios de 60 min) necesitas ~2.100 créditos: Creator no alcanza, hace falta Business con tier de ~2.400/mes, estimado en USD 80 a 150. Pre-recortar silencios y el pre-show ahorra ~30% de créditos.
| Proyecto | Stack | En CPU sin GPU |
|---|---|---|
| OpenShorts | faster-whisper + Gemini u Ollama + MediaPipe/YOLOv8. Modos TRACK, SPLIT, SCREENCAST | 5 a 8 min por video de 8 min. 8 GB RAM mínimo. Tiene MCP y API. |
| ClippyMe | YOLOv8 + FaceMesh (detecta quién habla por apertura de boca) + suavizado + detección de escenas | Docker CPU soportado. |
| auto-vertical-reframe | YOLOv11-seg + ByteTrack + PySceneDetect | Beta. |
| pyautoflip | Saliencia (sucesor del AutoFlip de Google) | Ligero. |
Estimación para tu VPS: un episodio de 60 min → 15 clips de 45 s ≈ 40 a 60 min de proceso. 500 piezas al mes ≈ 30 horas de CPU mensuales, en cola nocturna. Cabe.
Publicar es la parte que más sorprende a quien no la ha peleado. El código es fácil. Lo difícil es que cada plataforma exige aprobación previa para dejarte publicar por API.
| Plataforma | Realidad de su API (confirmado) |
|---|---|
| YouTube Shorts | ✅ API oficial abierta, la más fácil. Cuota diaria por unidades. |
| TikTok | ⚠️ Content Posting API con Direct Post, pero exige auditoría adicional de 5 a 10 días hábiles. Sin auditar, todo lo publicado queda en modo SELF_ONLY (privado). Es el mayor riesgo de cronograma. |
| ⚠️ Graph API solo para cuentas Business/Creator ligadas a una página de Facebook. Límite de 100 posts por API cada 24 h. Reels máximo 90 segundos por API (la app permite 3 min). | |
| ⚠️ Publicar como organización requiere Community Management API con solicitud formal, video demo y credenciales de prueba. La Posts API no tiene parámetro de agendamiento: el horario vive en tu sistema. | |
| X | ⚠️ API de pago por niveles, con límites de escritura ajustados. |
| Herramienta | API | Dato clave |
|---|---|---|
| Blotato | REST + servidor MCP + nodo oficial de n8n | Publica en 9 plataformas (IG, YouTube, TikTok, FB, LinkedIn, Threads, X, Pinterest, Bluesky). Resuelve por ti las auditorías y tokens. Hay plantillas listas en n8n. |
| Buffer | API en todos los planes, incluido el gratuito | Sólido y barato para empezar. |
| Metricool | API solo desde plan Advanced (~USD 67/mes) | Fuerte en analítica, más caro para la API. |
No vende "llamar APIs". Vende una aplicación ya aprobada por cada plataforma. Sus propios textos lo dicen: la aprobación de Instagram se hizo una vez, a nivel de la app de Blotato, y los refresh de tokens OAuth los manejan ellos. Tú conectas tu cuenta con un clic y heredas su App Review de Meta, su auditoría de TikTok, su tier de LinkedIn y su cuota de YouTube.
| Plan | USD/mes | Cuentas | Dato clave |
|---|---|---|---|
| Starter | 29 (24 anual) | 20 | API incluida. Topes propios: 50 IG/24h, 25 FB, 50 LinkedIn. Para 500 piezas al mes (~17/día) sobra. |
| Creator | 97 | 40 | Sin tope declarado. |
| Agency | 499 | Ilimitadas | Para operar clientes. |
Servidor MCP en mcp.blotato.com/mcp con 35 herramientas. Agenda con scheduledTime o useNextFreeSlot. Publicar no consume créditos (solo la parte de IA). Alternativa más barata: Zernio (~USD 24/mes, REST + webhooks + analytics).
Esto es lo que te ahorras al pagar USD 29:
| Plataforma | Qué exige | Plazo | Si no aprueban |
|---|---|---|---|
| TikTok | Auditoría con video demo del flujo completo, política de privacidad, web con la misma marca, y una UX obligatoria (mostrar avatar del creador, selector de privacidad, toggles de duet/stitch, declaración comercial) | 2 a 4 semanas con varias rondas | Todo se publica en privado para siempre y máximo 5 usuarios/día. Postiz (open source) fue rechazado en abril de 2026 y sigue sin resolver. |
| Meta (IG + Threads) | Verificación de empresa con documentos legales, screencast desde el login, entorno de prueba para el revisor | Meta subió su guía de 10 a 20 días en 2026 | Rechazos por "papeleo y screencast flojo", no por técnica. Reenvías y vuelves a la cola. |
| Entidad legal registrada, página verificada, email corporativo, screencast por caso de uso | 1 a 4 semanas; LinkedIn "contacta hasta 60 días después solo si hay encaje" | Sin recurso. Persona natural sin empresa: no aplica. Y el token expira a 60 días sin refresh salvo que seas partner. | |
| YouTube | Proyecto + OAuth verificado | Sacar la app de "Testing" (si no, los tokens duran 7 días) | Cuota por defecto: 100 subidas/día. Para 500 al mes no necesitas extensión. La más fácil. |
| X | Cuenta de desarrollador, pago por uso | Inmediato | USD 0,015 por post, 0,20 si lleva link. Evitar links en el post. |
GET /analytics, GET /posts/:id/analytics y GET /published-posts con vistas, alcance, likes, comentarios para 8 plataformas. LinkedIn devuelve vacío (exige Community Management aprobado incluso para leer).| Componente | Decisión | Por qué |
|---|---|---|
| Publicar | PAGAR Blotato 29 o Zernio 24 | Compras tres auditorías. Sin la de TikTok, todo queda privado. LinkedIn exige empresa. |
| Agendar y cadencia | CONSTRUIR | Franjas, reglas por plataforma, cadencia escalonada. El proveedor solo recibe la hora. |
| Cola de aprobación | CONSTRUIR | Ninguna API la resuelve bien y es donde el jefe querrá meter mano. |
| Medir | HÍBRIDO | Analytics de Blotato para 5 plataformas; LinkedIn a mano o vía Metricool si el volumen lo justifica. |
Cuándo construirlo sí sería correcto: si vas a operar más de 50 cuentas de clientes, o si el puesto exige propiedad total de datos y ya eres empresa registrada con 2 meses de margen. Para 500 piezas de una marca: paga el publicador, construye todo lo demás, y deja el conector abstraído para reemplazarlo si un día se justifica.
Esta es la parte que la mayoría de candidatos va a tratar como secundaria y que para WON es central: "Performance analysis that feeds directly back into future clip selection" y "Dashboards that monitor production velocity, quality, turnaround time, and business impact".
| Métricas de producción (el motor) | Métricas de audiencia (el resultado) |
|---|---|
| Grabaciones ingresadas por semana | Vistas y alcance por pieza y por plataforma |
| Piezas generadas por grabación | Retención (% que ve hasta el final) |
| Tasa de aprobación (aprobadas / generadas) | Engagement (likes, comentarios, compartidos, guardados) |
| Tiempo de ciclo: grabación → publicado | Clics y conversiones si hay CTA |
| Costo por pieza (tokens + herramientas) | Crecimiento de seguidores atribuible |
| Piezas publicadas por semana (la meta de 500) | Qué tipos de momento rinden más |
score, su tipo y su razon (del JSON del scorer).Tu CRM de reportes ejecutivos es la prueba de que sabes construir esto. Para WON sería un panel con las dos familias de métricas, actualizado desde las APIs (no a mano), con las mismas capas que ya usas: cierre semanal, embudo de producción (ingresado → generado → aprobado → publicado), y costo por pieza.
| Error | Qué pasa | Cómo se evita |
|---|---|---|
| AI slop | En 2025 el 52% de los artículos nuevos ya eran generados por IA. El daño no es de exactitud sino de credibilidad: la audiencia descuenta todo. | Aprobación humana obligatoria. Menos piezas mejores antes que más piezas genéricas. |
| Confundir volumen con velocidad | El cuello de botella real no es generar, es aprobar. Sin QC humano al final, el sistema publica clips sin contexto. | Diseñar la cola de aprobación como parte central, no como añadido. Aprobar en lote. |
| Clips huérfanos | El 80% del fallo: cortar un momento que necesitaba los 40 segundos previos. | El criterio de autosuficiencia con peso alto en el scoring. |
| Saturar un canal | Publicar todo el mismo día en la misma red quema a la audiencia. | Cadencia escalonada: episodio lunes, clips martes, blog miércoles, gráficos jueves, newsletter viernes. |
| No cerrar el bucle | 500 piezas sin retroalimentación de desempeño es una fábrica ciega. | El Capítulo 7. |
| Ignorar el riesgo legal | Clips de llamadas de venta y reuniones internas sin consentimiento. | El Capítulo 11. |
Te lo van a preguntar o lo vas a poder usar como argumento. Y tienes exposición real aunque no lo hayas nombrado así.
Model Context Protocol: un protocolo abierto, publicado por Anthropic a fines de 2024, para conectar modelos de IA con herramientas y datos externos de forma estándar. La analogía que más se usa: es el USB-C de la IA. Antes, cada integración entre un modelo y un sistema (tu CRM, tu base de datos, Slack) se construía a medida. Con MCP, escribes un "servidor" una vez y cualquier "cliente" compatible lo puede usar.
CLIENTE MCP SERVIDOR MCP
(Claude Code, ChatGPT, ←──────→ (expone capacidades)
Cursor, n8n, Antigravity)
Un servidor ofrece 3 cosas:
• TOOLS: acciones que el modelo
puede ejecutar (crear un
workflow, publicar un post)
• RESOURCES: datos que puede leer
(archivos, registros, docs)
• PROMPTS: plantillas reutilizables
El modelo no "sabe" cómo hablar con n8n o con Blotato. El servidor MCP traduce: le describe al modelo qué herramientas existen y qué parámetros necesitan, y ejecuta la acción cuando el modelo la pide.
Varias piezas del pipeline ya tienen servidor MCP: Blotato (publicar), Reap (clipear), openshorts (pipeline abierto). Eso significa que un agente puede, con lenguaje natural, decir "publica este clip en LinkedIn y TikTok mañana a las 9" y el servidor MCP lo ejecuta. Es la capa que convierte tus workflows en algo que un agente puede operar.
| Modelo | USD por millón (entrada / salida) | Fuerte en |
|---|---|---|
| Claude Fable 5.1 | $10 / $50 | Punta del ranking general. Razonamiento cuidadoso, escritura. |
| GPT-6 Astra (3-sep-2026) | $10 / $50 | Uso de computador y navegador, ingeniería de software. |
| Claude Opus 5 | $5 / $25 | Trabajo agéntico complejo, contexto 1M. |
| Claude Sonnet 5 | $2 / $10 | Equilibrio general. |
| Gemini 3.8 Flash (2-sep-2026) | $0,75 / $3,75 | Multimodal real: texto, imagen, audio, PDF y video. Contexto 1M. ⚠️ Precio se duplica el 1-ene-2027. |
| Claude Haiku 4.5 | $1 / $5 | Volumen, clasificación. |
Lo importante de Astra no es que escriba mejor: es que opera computador y navegador como una persona. Eso toca directamente el pipeline: CapCut, Canva y OpusClip no tienen API y por eso no se automatizan. Un modelo que maneja el navegador puede operarlas sin API.
La lectura práctica: n8n sigue ganando en procesos determinísticos, repetibles y baratos. Astra gana en lo que hoy se hace a mano porque no hay API. No se reemplazan, se reparten el trabajo.
Dos advertencias: cuesta $10/$50 (caro para volumen), y usa una técnica que oscurece su cadena de razonamiento, mala para procesos que necesitan auditoría.
Es multimodal con video a un precio de modelo pequeño. Para puntuar momentos no estás obligado a pasar solo por la transcripción: un modelo barato puede ver el video (gestos, expresiones, energía visual). Eso es "scoring multimodal, no solo transcripción", y es un argumento fuerte.
| Tráfico | Nivel | Para qué en el motor |
|---|---|---|
| ~70% | Barato (Gemini 3.8 Flash, Haiku 4.5) | Scoring de candidatos, clasificación por tipo, captions |
| ~20% | Medio (Sonnet 5) | Posts de LinkedIn con contexto, textos largos |
| ~10% | Frontera (Fable 5.1, Opus 5) | Análisis mensual del bucle, decisiones de estrategia |
Reportes de la industria citan reducciones de costo cercanas al 85% con este patrón, más caché de prompt (Anthropic: 0,1x en aciertos) y Batch API al 50%. Conecta directo con lo que hiciste al bajar tu prompt de 57k a 26k tokens.
No se memoriza, se mide: un timestamp antes de la llamada, otro después, se resta, se promedian 20 o 30 ejecuciones reales. En n8n, dos nodos Code alrededor de la llamada HTTP. Distingue tiempo al primer token (crítico en voz y chat en vivo) de tiempo total (lo que importa en un pipeline por lotes como este).
Flujos que se volvieron estándar: desarrollo guiado por especificación (spec-driven), agentes en paralelo con git worktrees, y el patrón Coordinador → Implementadores → Verificador (un agente aparte que revisa lo que hicieron los otros, lo más subutilizado según la literatura).
WON quiere clipear sales calls, customer meetings, workshops. Eso tiene implicaciones reales:
Mencionar esto te saca del grupo de "constructores de herramientas" y te mete en el de "gente que ha operado un negocio". Ya lo has vivido: en tu trabajo actual manejas datos de clientes y Habeas Data.
| Término | Qué es |
|---|---|
| Pilar / micro-pieza | La grabación larga original / cada pieza corta derivada de ella. |
| Repurposing | Reutilizar un contenido en múltiples formatos y plataformas. |
| Hook | Los primeros 1 a 3 segundos que deciden si el espectador se queda. |
| Payoff | El cierre del clip: la idea completa que justifica haberlo visto. |
| Clip huérfano | Fragmento cortado que no se entiende sin lo que vino antes. |
| Diarización | Identificar quién habla en cada momento de una grabación. |
| Timestamps por palabra | El tiempo exacto de inicio y fin de cada palabra transcrita. Necesario para cortar y subtitular con precisión. |
| Reencuadre / smart crop | Convertir video horizontal 16:9 en vertical 9:16 siguiendo al hablante. |
| .ass | Formato de subtítulos que permite animación, color y posición (efecto karaoke). |
| Quemar subtítulos | Incrustarlos en la imagen del video (no como pista aparte). Necesario para redes. |
| LLM como juez | Usar un modelo para puntuar candidatos contra criterios explícitos. |
| Few-shot | Incluir ejemplos de referencia en el prompt para que el modelo aprenda el criterio. |
| Routing por niveles | Enviar cada tarea al modelo más barato que la resuelva bien. |
| MCP | Model Context Protocol: estándar para conectar modelos con herramientas y datos. |
| Direct Post (TikTok) | Publicar directo por API. Exige auditoría; sin ella, todo queda privado. |
| Graph API (Meta) | La API de Instagram y Facebook. Solo cuentas Business/Creator. |
| Community Management API (LinkedIn) | La API para publicar como empresa. Requiere solicitud formal. |
| Tiempo de ciclo | Desde que entra la grabación hasta que la pieza está publicada. |
| Tasa de aprobación | Piezas aprobadas / piezas generadas. Mide la calidad del scorer. |
| Slop | Contenido generado por IA sin criterio ni revisión. Destruye credibilidad. |