Crea tu librería de samples con IA (Riffusion y Python)

por | agosto 1, 2026
A music producer in a home studio, wearing headphones, looking at laptop screen displaying an AI-generated spectrogram and sound waves, with moody lighting and analog synthesizers in the background.

Si produces música, sabes lo frustrante que es gastar horas buscando ese sonido perfecto en bibliotecas comerciales o grabando una y otra vez hasta dar con la muestra adecuada. La inteligencia artificial ha llegado para cambiarlo todo, y ahora mismo tienes a tu alcance herramientas capaces de generar samples completamente únicos a partir de una simple frase. Riffusion es una de ellas: un modelo basado en difusión que convierte texto en espectrogramas y luego en audio. ¿Lo mejor? Es gratuito, de código abierto y puedes ejecutarlo en tu propio equipo con Python. En esta guía te explico, paso a paso, cómo montar tu propia fábrica de samples con IA.

¿Por qué usar IA para crear samples?

Piensa en la cantidad de veces que has abandonado una idea porque el sonido que tenías en la cabeza no aparecía en ningún preset. Con Riffusion, el límite está en tu imaginación (y en lo descriptivo que seas al escribir prompts). Además, cada sample generado es tuyo de verdad, sin regalías ni problemas de licencias. La tecnología de difusión trabaja creando una imagen de espectrograma a partir de ruido y refinándola paso a paso, igual que hacen DALL‑E o Stable Diffusion con fotos. El resultado no siempre es perfecto —a veces aparecen artefactos o texturas inesperadas— pero para quien busca sonidos con personalidad, es una mina de oro.

¿Qué es Riffusion y por qué deberías probarlo?

Riffusion nació como un experimento que aplicaba los modelos de difusión de imágenes a espectrogramas de audio. Básicamente, toma un prompt como “bajo eléctrico funky a 120 BPM” y genera un espectrograma que, traducido a onda de sonido, produce ese sample. Al ser open source, puedes manipular los parámetros a tu antojo y generar cientos de muestras en minutos. No necesitas un estudio caro ni sintetizadores analógicos: un portátil medio y un café bastan. Eso sí, aviso: una vez que empieces, querrás generar más y más variantes.

Crea tu librería de samples con IA (Riffusion y Python)

Requisitos previos

  • Python 3.8 o superior instalado (en Mac y Linux suele venir; en Windows, descárgalo de python.org).
  • Conocimientos básicos de terminal: no pretendemos que seas programador, solo que copies y pegues comandos.
  • Al menos 4 GB de RAM y un procesador decente. Si tienes una GPU NVIDIA con CUDA, la generación se acelerará enormemente, pero no es imprescindible.
  • Unas cuantas gigas libres en disco si planeas crear cientos de samples.

Paso 1: Instalar Riffusion y sus dependencias

Abre la terminal o línea de comandos. Vamos a aislar el proyecto en un entorno virtual para no ensuciar tu sistema:

python -m venv riffusion_env

Actívalo: en Windows con riffusion_envScriptsactivate; en Mac/Linux, source riffusion_env/bin/activate. Ahora instala las bibliotecas necesarias. Trabajaremos con la pipeline de Hugging Face y PyTorch:

pip install torch diffusers transformers accelerate scipy numpy

Si tienes GPU NVIDIA, visita pytorch.org para instalar la versión CUDA. Con el comando anterior PyTorch usará CPU por defecto, lo cual es suficiente para pruebas.

Paso 2: Escribir el script generador

Crea un archivo llamado generador_samples.py y pega esto:

import torch
from diffusers import AudioLDMPipeline

# Cargar el modelo
pipe = AudioLDMPipeline.from_pretrained(
    "riffusion/riffusion-model-v1",
    torch_dtype=torch.float16 if torch.cuda.is_available() else torch.float32
)
pipe = pipe.to("cuda" if torch.cuda.is_available() else "cpu")

# Prompt y generación
prompt = "funky electric bass groove, 120 BPM, dry, no effects"
audio = pipe(prompt, num_inference_steps=30, audio_length_in_s=4.0).audios[0]

# Guardar como WAV
import scipy.io.wavfile as wavfile
wavfile.write("sample.wav", rate=22050, data=audio.numpy().T)
print("¡Sample guardado!")

El parámetro audio_length_in_s te da hasta 10 segundos, aunque la coherencia baja a partir de 5. Para samples de batería o FX, 2‑4 segundos van bien.

Paso 3: Generar múltiples samples con diferentes prompts

Para una librería, multiplica los prompts con un bucle:

prompts = [
    "subdrop and aggressive bass growl, dark atmosphere",
    "lofi hip hop drum loop, vinyl crackle, 85 BPM",
    "atmospheric pad, ambient, slow evolution, cinematic",
    "808 trap hihat roll, fast, crisp"
]

for i, prompt in enumerate(prompts):
    audio = pipe(prompt, num_inference_steps=30, audio_length_in_s=5.0).audios[0]
    wavfile.write(f"sample_{i+1}.wav", rate=22050, data=audio.numpy().T)
    print(f"Creado sample_{i+1}.wav: {prompt}")

Así, en pocos minutos tendrás una camada de sonidos. Cuanto más describas el contexto (estilo, tempo, carácter), mejor.

Paso 4: Post-procesamiento y organización

Los samples salen a 22050 Hz. Con pydub puedes subirlos a 44100 Hz y normalizarlos:

from pydub import AudioSegment

sound = AudioSegment.from_wav("sample_1.wav")
sound = sound.set_frame_rate(44100)
sound.export("sample_1_44k.wav", format="wav")

Organiza por carpetas (bajos, drums, pads, FX) para arrastrar directo a tu DAW.

Consejos para samples de calidad

  • Sé quirúrgico con el prompt: “piano house chord stab, bright, 128 BPM, Cm” da resultados mucho más precisos que “piano”.
  • Controla la semilla con torch.manual_seed(42) para poder repetir generaciones que te gusten.
  • Combina varias pasadas: a veces la tercera o cuarta iteración es la buena.
  • Mezcla lo generado con grabaciones propias; úsalo como capa de inspiración.

Preguntas frecuentes

¿Necesito GPU?

No obligatoriamente. Con CPU un sample de 4 s tarda un par de minutos; con GPU, segundos. Si vas en serio, merece la pena.

¿Es legal usar y vender estos samples?

Riffusion tiene licencia abierta. Puedes usarlos en tus producciones sin problema, incluso comercialmente. Si quieres distribuir las muestras por separado, revisa la licencia del modelo en Hugging Face.

¿Qué otra IA puedo probar?

Existen MusicGen, AudioLDM o Stable Audio. La idea es la misma: prompt y audio. Riffusion destaca por su simpleza y por ser 100 % autoalojable.