fix: content quality, image format, task monitor, calendar data source, search UI & sort
This commit is contained in:
@@ -110,6 +110,7 @@ def strip_thinking_html(html: str) -> str:
|
||||
r'<p[^>]*>最后.*?</p>',
|
||||
r'<p[^>]*>(总的来说|值得注意的是|换句话说|总而言之|简而言之|一言以蔽之|可以说|不难发现|由此可见|综上所述).*?</p>',
|
||||
r'<div[^>]*>(总的来说|值得注意的是|换句话说|总而言之|简而言之|一言以蔽之|可以说|不难发现|由此可见|综上所述).*?</div>',
|
||||
r'<p[^>]*>(开头钩子|核心观点|受众痛点|独特视角|差异化切入|内容形式).*?</p>',
|
||||
]
|
||||
for pat in patterns:
|
||||
html = re.sub(pat, '', html, flags=re.IGNORECASE)
|
||||
@@ -176,11 +177,16 @@ def clean_markdown_content(text: str) -> str:
|
||||
return '\n'.join(cleaned).strip()
|
||||
|
||||
def clean_html_content(html: str) -> str:
|
||||
"""清洗 HTML 输出:去 markdown 代码围栏头尾 + 去 AI 思考注释"""
|
||||
"""清洗 HTML 输出:去 markdown 代码围栏 + AI 思考 + 图片占位 + 结构标签"""
|
||||
html = re.sub(r'^```+\w*\s*\n?', '', html)
|
||||
html = html.strip()
|
||||
html = re.sub(r'\n?```+\s*$', '', html)
|
||||
html = strip_thinking_html(html)
|
||||
# 移除 LLM 插入的建议配图占位(<p><!-- 建议配图:... --></p>)
|
||||
html = re.sub(r'<p>\s*<!--\s*建议配图.*?-->\s*</p>', '', html, flags=re.DOTALL)
|
||||
# 移除可能变成可见文本的建议配图文字
|
||||
html = re.sub(r'<!--\s*建议配图.*?-->', '', html, flags=re.DOTALL)
|
||||
html = re.sub(r'建议配图:.*?(?=<|$)', '', html)
|
||||
return html
|
||||
|
||||
def clean_full_pipeline(text: str, output_format: str = 'markdown') -> str:
|
||||
|
||||
Reference in New Issue
Block a user