
很多人以为做 AIGC 创作,得先精通深度学习、会写训练循环、懂扩散模型数学。但真正开始做之后会发现:生成文本、图像、音频,现代 API 已经把复杂度压到了几行代码。
你真正要花时间的地方,是提示词、审美判断、工作流设计和后期筛选。代码只是把想法接进模型的插头。
下面走一遍完整链路:文本 → 图像 → 音频 → 接力创作 → 部署,全程少量代码。
以兼容 OpenAI 接口的模型为例,写一段科幻微小说只需要:
from openai import OpenAI
client = OpenAI()
r = client.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": "写一篇 300 字科幻微小说,主题:最后一盏路灯"}],
)
print(r.choices[0].message.content)换成国内任意兼容 OpenAI 协议的模型,代码几乎不用改。 AIGC 文本创作的关键不是“调通接口”,而是把 prompt 写成可复用的模板:
同样的接口,prompt 质量决定初稿质量。
用 diffusers 跑 Stable Diffusion,核心就是三行:
from diffusers import StableDiffusionPipeline
pipe = StableDiffusionPipeline.from_pretrained("runwayml/stable-diffusion-v1-5").to("cuda")
pipe("last street lamp in a silent city, cinematic, 35mm").images[0].save("lamp.png")第一次运行会下载模型,之后就可以反复生成。 图像创作里,提示词通常比代码长得多。一个可用的结构是:
主体 + 环境 + 风格 + 镜头 + 光线 + 画质
例如:
a lonely robot, rainy neon street, cyberpunk, wide shot, soft rim light, 8k
负向提示词可以过滤掉常见瑕疵:
blurry, low quality, extra fingers, watermark
代码少,不代表创作简单。生成十张,选一张,再修一张,才是常态。
如果只是给视频配旁白,TTS 工具可以非常短:
from gtts import gTTS
gTTS("最后一盏路灯还亮着。", lang="zh").save("line.mp3")要做更有表现力的角色配音,可以换成 Bark、CosyVoice 等生成式语音模型。 代码依然不多,重点在于文本断句、情绪标注和语速控制。
AIGC 创作最有意思的地方,是不同模态可以串起来:
story = r.choices[0].message.content
img = pipe(f"illustration of: {story[:80]}, watercolor").images[0]
img.save("cover.png")文本生成故事,故事前 80 字变成图像提示词,图像再作为封面。 你还可以继续接:
整条流水线的代码可能不到 50 行,但已经具备一个小型内容工作室的雏形。
只在自己电脑上跑,价值有限。用 Gradio 可以快速把生成能力变成网页:
import gradio as gr
gr.Interface(lambda p: pipe(p).images[0], "text", "image").launch()运行后浏览器打开本地地址,输入提示词就能出图。 如果要接入现有系统,换成 FastAPI 也只是多几行:
from fastapi import FastAPI
app = FastAPI()
@app.post("/gen")
def gen(prompt: str):
return {"image": pipe(prompt).images[0]}到这一步,AIGC 创作就从“脚本”变成了“工具”。
必须说清楚它不适合什么:
AIGC 创作不是“一键出成品”,而是生成—筛选—编辑—再生成的循环。代码少,是为了把时间留给判断和审美。
整条链路的核心代码加起来不到 30 行:
AIGC 创作正在把“实现想法”的成本降到极低。 但真正拉开差距的,仍然是你提什么问题、选什么风格、留下什么、删掉什么。
代码只是插头,创作才是电流。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。