Перейти к основному содержимому

Что мы узнали, прочитав 5000 файлов продавцов

Getly открывает каждый файл, приложенный к карточке, чтобы понять, что получит покупатель. Пять вещей, которые проявились на 5000 файлов, включая одну — наш собственный дефект.

3 мин. чтения
477 слов
Что мы узнали, прочитав 5000 файлов продавцов

Каждый файл, приложенный к карточке Getly, читается — не сканируется на вирусы, а именно читается: какой это формат на самом деле, сколько страниц, выделяется ли текст, каковы размеры картинки. Смысл в том, чтобы на странице товара стояли факты, которые продавцу не надо вписывать и в которых он не может ошибиться.

Вот что показали примерно 5000 файлов.

1. Каталог работает на документах

ФорматФайлов
PDF2247
PNG1458
JPEG1267
WebP30

PDF не просто на первом месте — его больше, чем любого формата картинок по отдельности. Чем бы этот маркетплейс ни был ещё, в основном здесь люди продают документы, — и инструменты должны следовать за этим, а не за более нарядными категориями.

2. Имя файла — это утверждение, а не факт

Определение формата читает первые байты файла, а не расширение. Это не педантизм: переименованный исполняемый файл, приезжающий как bundle.zip, раньше проходил, потому что запретный список работал по именам, а имя — единственное, что атакующий контролирует полностью. Шестнадцать байт подписи это закрыли.

Тот же принцип ловит честные ошибки. Файл, сохранённый как .png, а на деле являющийся JPEG, встречается часто, и это важно покупателю, которому нужна прозрачность.

3. Продавцы обещают прозрачность, которую не отдают

Замер по мастеру создания товара: 21 из 29 карточек, чьё описание обещало PNG или прозрачность, отдавали JPEG — двенадцать разных магазинов. Ни один из них не был нечестен. Они выгружали из инструмента, у которого по умолчанию JPEG, и не проверили.

Мастер теперь сравнивает то, что говорит описание, с тем, что представляют собой файлы, — в браузере, и сообщает об этом до публикации. Он никогда не блокирует: расхождение — это подсказка, а не приговор, и для него бывают законные причины.

4. Наш собственный читатель был неверен месяцами

Самая нелестная находка. Факты читались из первых 512 КБ файла, на разумно звучащей теории, что всё нужное лежит в заголовке. Верно для картинки. Неверно для PDF, чьи страницы записаны по всему файлу.

Поэтому книга на 6.9 МБ с 295 страницами числилась как 10-страничная — потому что ровно десять маркеров страниц попали в окно, которое мы смотрели. 1426 карточек несли число страниц, полученное таким способом, и каждая занижала файл. Продавцу пришлось написать нам дважды, прежде чем мы это нашли.

Все пересчитаны, и правило теперь такое: число страниц показывается только когда файл удалось прочитать целиком. Где не удалось — не показывается ничего: уверенное неверное число хуже пустоты.

5. Большинство файлов в порядке

Такой текст легко было бы написать как список всего, что не так с тем, что загружают продавцы. Данные говорят не это. Подавляющее большинство файлов — именно то, что заявлено в карточке, в разумном формате и разумного размера. Средний PDF — 33 страницы, и он открывается правильно. Картинки того размера, который указан.

Собственно, в этом и аргумент за чтение файлов: не поймать кого-то, а чтобы честное большинство получало факты на своей странице товара автоматически, вместо того чтобы писать «50 страниц, текст выделяется, A4» и надеяться, что покупатель поверит.

Готовы начать продавать?

Независимый маркетплейс для цифровых авторов. Получайте 80–90% с каждой продажи. Принимаем карты и стейблкоины.