Tous les articles

Fondu audio au montage : couper un clip sans pop

Deux bandes de forme d'onde audio séparées par un trait vertical fin : la bande du haut s'arrête net, celle du bas s'éteint en douceur.

Le clic qu'on entend quand un clip est coupé n'est pas un fichier abîmé : c'est un saut vertical dans la forme d'onde, créé à l'instant où l'on recolle deux points qui n'ont jamais été voisins. Voici comment couper un clip sans pop, et la passe son en trois étapes qui tient sur tout un lot.

D'où vient le « pop »

Coupez un clip au milieu d'une phrase et vous entendez un clic. Rien n'est cassé : vous venez de demander au son de passer d'un niveau à un autre entre deux échantillons. Une forme d'onde monte et descend ; dès que vous recollez deux points qui n'ont jamais été voisins, la ligne devient verticale — et cette verticale, c'est le pop.

L'endroit de la coupe décide de sa gravité. Trois zones, de la pire à la meilleure :

  • Dans une voyelle tenue — l'amplitude est proche de son maximum, donc le saut aussi. C'est le clic qu'aucune musique ne masque.
  • Dans une respiration ou une pause — l'amplitude est proche de zéro, le saut est petit. Encore audible au casque.
  • Sur un vrai silence, ou là où la forme d'onde croise son axe — il n'y a presque rien à entendre. C'est là que les coupes doivent tomber.

Deuxième échec, plus discret, qui surprend : la pièce. Toute prise de son transporte un fond de salle — le room tone — et ce fond change entre les deux côtés de la coupe. Collez un passage enregistré dans une pièce contre un passage d'un autre jour, et vous obtenez un léger craquement d'ambiance même quand les mots s'enchaînent parfaitement. C'est le même joint qui fait qu'on entend deux prises faites en studio.

Rien de tout cela ne vient du micro. Cela vient du joint.

Un fondu d'une image ne suffit pas, et la mauvaise courbe est pire

Le réflexe, c'est de poser un fondu sur la coupe. Ça marche, jusqu'à un point, et les modes d'échec sont documentés.

Votre logiciel propose trois formes de fondu enchaîné, et elles ne sont pas interchangeables : la documentation Adobe des trois fondus le dit elle-même. Le Gain constant fait varier le niveau à un rythme constant, et il « peut parfois produire une baisse de volume perceptible au milieu de la transition » : vous avez échangé un clic contre un trou. La Puissance constante est celle qui est faite pour la parole — Adobe la décrit comme « analogue à la transition par fondu enchaîné entre deux clips vidéo ». Le Fondu exponentiel reprend l'idée sur une courbe logarithmique, « plus graduelle » que la puissance constante.

La longueur compte plus que la courbe. Une image à 30 images par seconde dure 33 millisecondes : de quoi arrondir un clic, pas de quoi masquer un collage dans une voyelle. En pratique, 2 à 4 images de chaque côté est la plage qui tient au casque — 67 à 133 ms à 30 i/s, 83 à 167 ms à 24 i/s.

Et un fondu doit être posé aux deux bouts. En entrée seulement, le clic déménage en sortie : le spectateur l'entend à la sortie du clip, c'est-à-dire au moment précis où vous voulez qu'il reste.

La passe son en trois étapes, à faire sur chaque clip

À lancer dans cet ordre, avant tout le reste.

  1. Coupez là où le son est déjà à zéro : sur une pause, une consonne, ou un croisement de la forme d'onde. Jamais au milieu d'une voyelle tenue.
  2. Posez un fondu aux deux bouts de chaque point de coupe : 2 à 4 images en entrée, 2 à 4 en sortie. Remplacez les deux fondus par un fondu enchaîné (puissance constante) quand les deux côtés portent du son continu, musique ou ambiance.
  3. Couvrez le joint : laissez le fond de salle ou la musique se poursuivre sous le raccord, pour que l'oreille ait quelque chose de continu à suivre.

Ensuite, arrêtez-vous. La question du niveau se règle toute seule : votre clip n'est pas écouté au volume que vous avez exporté. Les plateformes appliquent une normalisation à la lecture — la référence de loudness de Google for Developers définit les LUFS comme le standard qui existe pour que les producteurs évitent « des sauts d'amplitude qui obligeraient l'auditeur à régler le volume sans arrêt ». Monter le volume ne fait pas écouter plus fort : ça fait redescendre la piste, parfois en tirant des artefacts au passage. La régularité d'un clip à l'autre compte plus que n'importe quel chiffre cible.

L'étape de découpe elle-même a un levier ici, et ça vaut la peine de le savoir avant de passer l'après-midi sur des fondus. Les outils qui resserrent le silence résolvent le même problème : la fonction Supprimer le silence d'Adobe Audition identifie les régions inactives et les supprime sans perdre la synchronisation dans un montage multipiste. La voie la moins chère reste de ne jamais fabriquer le mauvais joint.

Là où la passe casse : douze clips, quarante joints

Sur un seul clip, la passe prend quatre-vingt-dix secondes. Sur un lot, elle prend l'après-midi, pour une raison de structure : les points de coupe se multiplient. Un clip de 45 secondes tiré de quatre moments porte trois ou quatre joints ; un joint a deux extrémités, donc six à huit fondus à poser et à vérifier. Douze clips, et vous êtes à soixante-dix ou cent retouches sonores, chacune un endroit où se tromper — et toutes à écouter au casque, parce que c'est la seule façon de les entendre.

C'est aussi la partie qu'un outil ne vous rendra pas finie. Un logiciel qui trouve les moments à votre place vous rend quand même une timeline à auditionner : le fondu, le fond de salle et le niveau relèvent de l'écoute, pas du calcul. Cette passe de relecture a son propre article — ce qu'un lot de clips générés demande encore de vous — et le joint audio est l'une des raisons de son existence.

Une chose que la coupe peut faire pour vous. Si l'outil découpe depuis la transcription, sur les limites de mots, le collage tombe sur une frontière que le son respecte : entre deux mots, pas dans une voyelle. C'est la différence entre un clip qui demande un fondu à chaque joint et un clip qui n'en demande qu'à l'endroit où les deux côtés se contredisent. La chaîne de production de clips de ClipFinish fonctionne ainsi : elle découpe depuis la transcription, sur les limites de mots, et rend un clip vertical avec les sous-titres mot à mot. Elle ne mixe pas votre son, ne normalise pas le volume et ne nettoie pas une mauvaise source : cette passe reste la vôtre, et c'est l'objet de la section suivante.

Si vous voulez situer cette passe dans le reste de la chaîne, où passe le temps de montage chiffre les étapes que personne ne budgete, et monter une vidéo depuis sa transcription explique ce qu'une coupe par transcription donne — et ce qu'elle ne donne pas.

Ce que cette passe ne répare pas

Un joint propre n'est pas une source propre. La différence, honnêtement :

  • Une source bruitée reste bruitée. Bourdonnement de climatisation, ventilateur, frigo : la réduction de bruit baisse le plancher et emporte souvent un peu de voix avec elle. Douce, c'est un échange ; forte, ça s'entend.
  • On ne coupe pas une réverbération. Une prise faite dans une pièce dure transporte sa propre queue : chaque coupe que vous faites dans cette queue est un joint contre du reverb.
  • Un son superposé reste superposé. Si la source est un stream où le jeu, les alertes et la voix partagent une seule piste, aucune coupe ne les sépare — il faudrait des pistes séparées qu'on ne vous a pas données.
  • Une syllabe avalée est perdue. Si la phrase dont vous avez besoin est à moitié marmonnée, le fondu ne la reconstruira pas.
  • La normalisation n'est pas votre travail. Cherchez la régularité d'un clip à l'autre plutôt qu'une cible chiffrée, et laissez le lecteur faire ce qu'il fait.

Réponses courtes

Un fondu d'une image suffit-il ?
À 30 i/s, une image dure 33 ms. C'est assez pour supprimer le clic d'une coupe qui tombe déjà près du silence, et pas assez pour masquer un collage dans une voyelle. Posez 2 à 4 images aux deux bouts avant de conclure que les fondus ne marchent pas.
Faut-il normaliser ses clips à -14 LUFS ?
Visez la régularité d'un clip à l'autre plutôt qu'un chiffre. Le lecteur normalise à la lecture : la référence de loudness de Google définit les LUFS comme le standard qui existe précisément pour que l'auditeur n'ait pas à régler le volume en permanence, et recommande -16 LUFS pour de la parole en stéréo. Un clip beaucoup plus fort que les autres s'entend au défilement.
Comment couper un « euh » sans pop ?
Laissez de l'air : coupez environ 100 ms avant et après le « euh », pour que le collage tombe dans le silence et non contre la voyelle d'à côté, puis posez un fondu aux deux extrémités. Couper au ras de la voyelle, c'est fabriquer le clic qu'on voulait éviter.

Le point de coupe est un détail qui décide si un clip a l'air monté ou seulement assemblé. Trois règles en couvrent l'essentiel : coupez là où le son est déjà faible, posez un fondu aux deux bouts, gardez quelque chose de continu sous le joint. Ensuite, écoutez au casque avant d'envoyer : le pop n'apparaît jamais dans la forme d'onde que vous avez regardée, seulement dans celle que vous avez entendue.

Si c'est la découpe elle-même qui vous prend vos soirées, la chaîne de production de clips de ClipFinish prend la recherche des moments et les sous-titres à sa charge, pour ne vous laisser que la passe que seules les oreilles peuvent faire.

Tu choisis les passages. ClipFinish fait le reste.

Dépose ta vidéo longue, coche les passages dans le transcript, et récupère le lot entier : recadré, sous-titré, prêt à publier.

Essayer Gratuitement

5 minutes de clips montés offertes chaque mois. Sans carte bancaire. Sans filigrane.