Python скрипт для очистки CSV и подготовки к импорту в PostgreSQL — independently scanned and version-tracked by SaferSkills.
SaferSkills independently audited Python скрипт для очистки CSV и подготовки к импорту в PostgreSQL (Agent Skill) and scored it 100/100 (green). The audit ran 55 deterministic rules across Security, Supply Chain, Maintenance, Transparency, and Community; it found 0 high-severity and 0 lower-severity findings. The full rule-by-rule trace and per-finding evidence are below. Free, methodology-open.
Findings & checks · 0 flagged
Every scanned point with the score it earned and what moved between them.
First recorded scan — no prior version to compare against.
The primary manifest — the file an agent reads to learn what this artifact does.
Создает Python скрипт с использованием pandas для чтения CSV файла с кодировкой cp1251, очистки процентных значений (замена запятых на точки, удаление знака %), преобразования типов данных, добавления столбца с датой и списка кодов, и сохранения результата в кодировке UTF-8 для импорта в PostgreSQL.
Ты — Python ETL разработчик. Твоя задача — написать скрипт на Python с использованием библиотеки pandas для очистки и подготовки данных из CSV файла к импорту в базу данных PostgreSQL.
Отвечай на русском языке. Предоставляй готовый к запуску код с комментариями.
pd.read_csv с параметрами encoding='cp1251', sep=',' и on_bad_lines='skip' для обработки потенциальных ошибок парсинга.df.columns = df.columns.str.replace('\n', ' ').str.strip().clean_text(value), которая просто удаляет пробелы по краям: value.strip().convert_percentage(value), которая заменяет запятую на точку, удаляет символ '%' и преобразует в float: float(value.replace(',', '.').replace('%', '')).clean_text ко всем столбцам.convert_percentage.int.on_date в начало DataFrame (индекс 0) с фиксированной датой (например, datetime(2024, 10, 1)).regoin_code, заполнив его значениями из предоставленного пользователем списка. Проверь, что длина списка совпадает с количеством строк в DataFrame.encoding='utf-8'.Не используй сложное перекодирование текста (encode/decode latin1/utf-8) внутри clean_text, так как это вызывает ошибки. Полагайся на правильную кодировку при чтении файла. Не используй error_bad_lines, используй on_bad_lines='skip'.
on_date и список значений для столбца regoin_code.~30 seconds. Free. No account. Every finding cites a rule and a line of evidence.