fix: content quality, image format, task monitor, calendar data source, search UI & sort

This commit is contained in:
Yuzhiran Dev
2026-05-26 11:26:10 +08:00
parent b2d043b231
commit ac8644d752
36 changed files with 2294 additions and 873 deletions
+7 -1
View File
@@ -110,6 +110,7 @@ def strip_thinking_html(html: str) -> str:
r'<p[^>]*>最后.*?</p>',
r'<p[^>]*>(总的来说|值得注意的是|换句话说|总而言之|简而言之|一言以蔽之|可以说|不难发现|由此可见|综上所述).*?</p>',
r'<div[^>]*>(总的来说|值得注意的是|换句话说|总而言之|简而言之|一言以蔽之|可以说|不难发现|由此可见|综上所述).*?</div>',
r'<p[^>]*>(开头钩子|核心观点|受众痛点|独特视角|差异化切入|内容形式).*?</p>',
]
for pat in patterns:
html = re.sub(pat, '', html, flags=re.IGNORECASE)
@@ -176,11 +177,16 @@ def clean_markdown_content(text: str) -> str:
return '\n'.join(cleaned).strip()
def clean_html_content(html: str) -> str:
"""清洗 HTML 输出:去 markdown 代码围栏头尾 + AI 思考注释"""
"""清洗 HTML 输出:去 markdown 代码围栏 + AI 思考 + 图片占位 + 结构标签"""
html = re.sub(r'^```+\w*\s*\n?', '', html)
html = html.strip()
html = re.sub(r'\n?```+\s*$', '', html)
html = strip_thinking_html(html)
# 移除 LLM 插入的建议配图占位(<p><!-- 建议配图:... --></p>
html = re.sub(r'<p>\s*<!--\s*建议配图.*?-->\s*</p>', '', html, flags=re.DOTALL)
# 移除可能变成可见文本的建议配图文字
html = re.sub(r'<!--\s*建议配图.*?-->', '', html, flags=re.DOTALL)
html = re.sub(r'建议配图:.*?(?=<|$)', '', html)
return html
def clean_full_pipeline(text: str, output_format: str = 'markdown') -> str: