#!/usr/bin/env python3
"""
清理已发布的 HTML 文件:
1. 删除所有 标签
2. 清理标题中的 (约XXX字) 括号
"""
import re
from pathlib import Path
files = [
"automation/data/releases/2026-04-21/zhihu/zhihu_TOPIC-BBB1CC_zhihu.html",
"automation/data/releases/2026-04-21/wechat/wechat_TOPIC-BBB1CC_wechat.html",
"automation/data/releases/2026-04-21/xiaohongshu/xiaohongshu_TOPIC-BBB1CC_xiaohongshu.html"
]
def clean_html(html: str) -> str:
# 1. 删除所有
标签
html = re.sub(r'
]*>', '', html)
# 2. 清理标题中的 (约XXX字) 等括号内容
def clean_text(text: str) -> str:
text = re.sub(r'[((]约\s*\d+字[))]', '', text)
text = re.sub(r'[((]MVP[))]', '', text)
text = re.sub(r'[((][^))]*?[))]', '', text) # 保守移除任意括号内容
return text.strip()
# 处理