重点:需要安装chrome浏览器
下载地址:
https://github.com/congzhen/cm_collectors_3

下载解压后包含以下文件:
scraper 目录:存放刮削配置文件cm_collectors_scraper_debugger.exe:刮削器主程序test.json:刮削器调用配置文件
test.json
{
"headless": false, // 是否使用无头浏览器,为true就不会打开浏览器显示
"visitHome": false, // 是否访问主页
"scraperConfig": "./scraper/javbus_scraper.json", // 刮削配置文件路径
"id": "MIMK-244", // 刮削ID
"savePath": "./save/", // 默认保存路径
"batch": false, // 是否批量刮削
"batchSkipExitsNfo": true, // 是否跳过已存在的nfo文件
"batchFolderPath": "G:/a2/test", // 批量处理的文件夹路径
"batchExtensions": ".mp4,.mkv", // 批量处理的文件扩展名,英文逗号分割
"timeOut": 30, // 刮削超时时间
"retryCount": 3, // 刮削失败重试次数
"imageUseTagName": true, // 是否使用标签名作为图片名称
"enableScrollSimulation": false, // 是否启用滚动模拟
"log": true // 是否启用日志
}
複製代碼单文件刮削
设置 batch 为 false,配置 id 和 savePath 参数,运行程序即可刮削指定影片数据到目标文件夹。
批量刮削设置 batch 为 true,配置批量处理相关参数,程序将扫描指定文件夹内的视频文件并进行批量刮削。在此模式下,id 和 savePath 参数将失效。
设置下使用scraper文件夹下的指定配置文件后保存,并运行cm_collectors_scraper_debugger.exe 即可开始刮削。
也可以自行创建和修改刮削配置参考 scraper 文件夹内的 JSON 文件创建自定义配置。必备字段包括:name:配置名称cache_enabled:是否启用缓存file_patterns:文件匹配模式sites:刮削站点配置
sites 配置中:selector:CSS 选择器,定位页面元素type:提取类型(text-文本, array-数组, attribute-属性)attribute:要提取的属性名fallback_attributes:备用属性列表,当主属性不存在时按顺序尝试post_process:数据后处理配置,对提取的数据进行进一步处理
在 selectors 外可配置后置处理器,对特定字段进行额外处理:
"post_processors": {
"premiered": {
"type": "regexp",
"pattern": "([0-9]{4}-[0-9]{2}-[0-9]{2})"
},
"runtime": {
"type": "regexp",
"pattern": "([0-9]+)分鐘"
}
}複製代碼此配置将对 premiered 和 runtime 字段应用正则表达式提取,精炼原始数据。
还有其他属于与方法,可以参考下其他的配置文件。
刮削后得到nfo与图片

如果你觉得自己配置比较麻烦,可以下载CM Collectors 3使用
还没有评论,来抢沙发吧。