Claude ne sait pas regarder une vidéo. Un skill lui fabrique cette entrée. Il récupère la transcription horodatée, puis découpe la vidéo en images. Claude lit ces images comme des captures d’écran, et répond sur ce qui s’y passe.
Je n’ai pas écrit celui-là. Il vient de bradautomates, sous licence MIT. Voici ce qu’il fait, ce qu’il coûte, et où il se casse.
Ce qui se passe quand on lui donne une URL
Quatre étapes, dans cet ordre, et l’ordre compte pour la facture.
- Les sous-titres d’abord. Le script tente de récupérer la transcription native de la plateforme. C’est gratuit et c’est souvent suffisant.
- La vidéo ensuite, seulement si on veut des images. En mode transcription seule, le téléchargement est évité quand les sous-titres existent.
- L’extraction des images. Deux méthodes : les images clés, quasi instantanées, qui tombent sur les coupes de plan. Ou la détection de changement de scène, plus lente et plus fine.
- La lecture. Le script affiche les chemins des images. Claude les ouvre d’un coup et les recale sur la transcription.
Sans sous-titres, le script extrait la piste audio, environ 0,5 Mo par minute. Whisper la transcrit si une clé est configurée. Sans clé, il travaille sur les images seules et l’annonce.
Le réglage qui décide de la facture
C’est la première question d’une équipe : combien ça coûte.
Le coût en jetons suit le nombre d’images. Il se règle par paliers :
| palier | images | méthode |
|---|---|---|
| transcription | aucune | sous-titres seuls, pas de téléchargement |
| rapide | 50 au maximum | images clés |
| par défaut | 100 au maximum | détection de scène |
| sans plafond | illimité | détection de scène, avertissement au-delà de 250 |
À cela s’ajoute un budget par durée. Sur une vidéo de trois à dix minutes, le script vise environ 80 images. Au-delà de dix minutes, elles s’espacent et il prévient. Un filtre supprime les images quasi identiques à la précédente. Une diapositive affichée deux minutes ne coûte donc qu’une image.
En pratique, sur un replay d’une heure : on lit d’abord la transcription seule. Puis on rappelle l’outil sur les deux ou trois passages qui comptent, plus densément.
Le détail qui montre que l’outil a servi
La détection de scène rate les moments où l’intervenant dit « regardez ici ».
Logique : pointer une diapositive ne change presque rien à l’image. Le moment le plus important de la démonstration est visuellement le plus calme, donc l’algorithme l’ignore.
Le skill prévoit une option pour ça. On lit la transcription. On repère les phrases qui pointent quelque chose, et on force une image à cet horodatage. Ces images sont réservées avant la sélection automatique, donc elles ne sautent jamais.
L’auteur a buté sur le problème avant nous.
À quoi ça sert chez vous
Quatre usages qui reviennent, et aucun n’est spectaculaire.
- Dépouiller un webinaire concurrent sans y passer l’heure entière, avec les horodatages pour vérifier une citation.
- Contrôler une démo fournisseur en revenant image par image sur le moment où la fonctionnalité est montrée.
- Transformer une session interne filmée en compte rendu horodaté, exploitable par ceux qui n’étaient pas là.
- Vérifier une vidéo de conformité avant diffusion : le discours colle-t-il aux images ?
Le point commun : une heure de travail pour dix minutes utiles. C’est pour ça qu’on les repousse.
Ce qu’il faut avant de lancer
Deux petits programmes, yt-dlp et ffmpeg. Sur macOS, le script d’installation les pose lui-même. Ailleurs il affiche les commandes.
Une clé d’API Whisper est facultative. Elle ne sert que pour les vidéos dépourvues de sous-titres. Sans elle, le skill tourne quand même, avec une capacité réduite qu’il annonce.
C’est le premier d’une série sur des outils qu’on utilise en formation. Celui-ci est public, d’autres sont les miens, et l’objectif n’est pas d’en accumuler. C’est que vos équipes sachent en écrire.
Agent IA, c’est quoi explique la mécanique générale. Claude Code, c’est quoi présente l’outil qui les fait tourner. Pour outiller une équipe sur ses propres tâches, c’est la formation Claude Code et n8n, animée par Fathi Sehla.
Crédit
Skill watch, version 0.2.0, par bradautomates, licence MIT.
Dépôt : github.com/bradautomates/claude-video.